このサイトでは、クローラーが robots.txt の指定をどの程度守るかを観測しています。
このページはその実験の説明です。
このサイトの robots.txt には、収集を許可したパスと禁止したパスの両方を書いてあります。
そのうえで、各パスに実際にどのクローラーが到達したかを記録しています。
観測対象は robots.txt の遵守状況そのものであり、それ以上のことは調べていません。
実験の性質上、どのパスを許可・禁止に割り当てているかはここには書きません。
観測に使うのは、このサイト(lab.guest-reply.jp)自身のアクセスログのみです。 外部サイトへの調査や、他者のログの取得は行っていません。 記録しているのは、通常の HTTP アクセスログに含まれる範囲 (時刻・接続元 IP アドレス・要求パス・ステータス・User-Agent・Referer 等)です。
User-Agent は誰でも自由に名乗れるため、それだけでは発信元の証拠になりません。 したがって、特定のクローラーや運営者を名指しして「robots.txt を守らなかった」と断定する前に、 接続元 IP アドレスが当該事業者の公表するアドレス範囲に含まれるかを照合します。
IP で照合できなかったアクセスは、確認できていないものとして別枠で扱い、 事業者を特定した記述はしません。アドレス範囲を公表していない事業者についても同様です。
この実験について質問・訂正の依頼・除外の要望がある場合は、下記までご連絡ください。