Webページ本文をまとめてExcelへ収集する方法
Web調査では、検索結果を見つけることより、その後にページを開き、該当文を探し、前後関係と出典URLを表へ揃える作業に手間がかかることがあります。収集前に開始URL、対象サイト、キーワード、残したい情報を決めると、後の確認がしやすくなります。
開始URLとキーワードを決める
収集前に、どの公開ページから調査を始めるかと、どの語を探すかを決めます。開始URLとキーワードを先に固定すると、複数ページを同じ基準で確認しやすくなります。
原文だけでなく前後文と出典を残す
該当する一文だけを残すと、後から意味や根拠を確認しにくくなることがあります。原文、前後文、ページタイトル、出典URLを同じ粒度で残し、どのページのどの文脈だったかを追えるようにします。
同一サイト内のどこまで辿るか決める
公開HTMLを自動で辿る場合は、対象サイトの範囲を決めます。Web原文収集ツールは開始URLと同じホスト内のリンクを対象とするため、別ホストのページは同じ巡回対象として扱いません。
robots.txtと公開範囲を守る
自動巡回では、対象サイトのrobots.txtを尊重し、通常のHTTP通信でHTML本文を返す公開ページを対象にします。アクセス制限を回避して取得する前提にはしません。
ログイン・CAPTCHA・JavaScript後表示・PDF等は分ける
ログインやCAPTCHAが必要なページ、JavaScript実行後にだけ本文が現れるページ、PDF・Office文書・画像などは同じ取得方法の対象外です。自動収集できない対象は別作業として分け、必要に応じて目視確認します。
ツールを使う場合
Web原文収集ツールは通常のHTTP通信で本文を返す公開HTMLを対象に、同じホスト内を巡回し、ヒット文・前後文・ページタイトル・URLをXLSXまたはCSVへ出力します。
