開始URLとキーワードを決める

収集前に、どの公開ページから調査を始めるかと、どの語を探すかを決めます。開始URLとキーワードを先に固定すると、複数ページを同じ基準で確認しやすくなります。

原文だけでなく前後文と出典を残す

該当する一文だけを残すと、後から意味や根拠を確認しにくくなることがあります。原文、前後文、ページタイトル、出典URLを同じ粒度で残し、どのページのどの文脈だったかを追えるようにします。

同一サイト内のどこまで辿るか決める

公開HTMLを自動で辿る場合は、対象サイトの範囲を決めます。Web原文収集ツールは開始URLと同じホスト内のリンクを対象とするため、別ホストのページは同じ巡回対象として扱いません。

robots.txtと公開範囲を守る

自動巡回では、対象サイトのrobots.txtを尊重し、通常のHTTP通信でHTML本文を返す公開ページを対象にします。アクセス制限を回避して取得する前提にはしません。

ログイン・CAPTCHA・JavaScript後表示・PDF等は分ける

ログインやCAPTCHAが必要なページ、JavaScript実行後にだけ本文が現れるページ、PDF・Office文書・画像などは同じ取得方法の対象外です。自動収集できない対象は別作業として分け、必要に応じて目視確認します。

ツールを使う場合

Web原文収集ツールは通常のHTTP通信で本文を返す公開HTMLを対象に、同じホスト内を巡回し、ヒット文・前後文・ページタイトル・URLをXLSXまたはCSVへ出力します。