1. クローラーの識別と目的
製品トークンはSearchProofBotで、運用User-AgentはSearchProofBot/1.0 (+https://searchproofai.com/crawler-policy)です。利用者指定ドメインの検索・AI可視性診断と根拠提供専用で、一般検索索引、広告プロファイル、AI学習データ販売を目的としません。
2. 実行者と分析権限
利用者がドメインで診断を開始するか保存プロファイルが再実行されると収集します。利用者は所有・管理者または正当な業務上の利害を有する必要があります。無権限の通報時は調査し、停止・制限し、所有確認を求められます。
3. アクセス範囲とページ上限
- ログイン不要で公開された同一サイトのHTTP・HTTPS HTML
- 無料最大5、詳細最大100ページ。試行数・発見キューにも上限
- 静的HTML優先。設定時のみ制限付き外部レンダラー
- クローラーは認証情報・セッションCookieを送信せずフォーム送信もしません。私設IP、localhost、クラウドメタデータ、危険ポート、遮断種類にはアクセスしません。ただし認証なしで公開されたログイン・管理経路はrobots.txtで遮断されなければ公開HTML候補となる場合があるため、非公開資源は認証で保護し必要ならSearchProofBotを明示的に遮断してください。
4. URL発見と同一サイト制限
開始URL、robots.txtのSitemap、サイトマップ索引、訪問HTML内部リンクから候補を発見します。各URLとリダイレクトごとにスキーム、ホスト、DNS・IP、安全性、同一サイトを再検証します。追跡クエリ・重複を正規化し、PDF、圧縮、画像、実行ファイル等を除外します。
5. robots.txtとページ指示
収集前に/robots.txtを取得しSearchProofBotまたは*のDisallowと合理的Crawl-delayを反映します。現実装はRFC 9309の全Allow優先・エラーキャッシュを完全実装すると主張しません。複雑な指示は明示的SearchProofBot Disallowと公式遮断依頼を併用してください。noindex等は診断根拠として記録し、アクセス制御回避権限ではありません。非公開資源は認証で保護してください。
User-agent: SearchProofBot
Disallow: /
# Or block a path
User-agent: SearchProofBot
Disallow: /private-area/6. リクエスト頻度・容量・保護策
- サイト別直列、基本250ms以上。robots Crawl-delayは最大2秒まで反映
- 既定:接続10秒、要求20秒、リダイレクト5回、応答5MiB
- 各リダイレクトでDNS・IP再検証、プライベート・ループバック・リンクローカル・メタデータ等遮断
- 取消、上限、反復エラーで後続要求停止
7. 収集・保存フィールド
要求・最終URL、HTTP状態、種類、時間、タイトル、メタ、言語、canonical、robots指示、見出し、可視本文、リンク、alt、構造化データ、ハッシュ、時刻、性能、再現用HTML証拠を保存できます。結果にスコア、規則根拠、URLを含みます。本文は上限内のみ処理し非対応種類を除外します。
8. 収集・別途利用しないデータ
- ログイン情報、セッションCookie、フォーム送信、決済情報、認証ページ
- 偶発的個人情報を人物プロファイル・マーケティング名簿へ別途抽出
- 収集HTMLを一般検索索引、基盤モデル学習、第三者データ商品として販売
9. 保存・削除・AI観測との区別
非会員HTML証拠は7日超を日次削除し、滞留・再試行で短い遅延があり得ます。保存分析等はアカウント削除まで保管し法定記録を分離します。個別永久削除機能は提供時に案内します。詳細分析のAI質問・応答は別工程で選択モデルへ送信されます。無料SEO診断は外部AIを使わず、未接続は未測定です。AI提供者の独自収集はSearchProofBotとは別です。
10. 遮断・速度調整・削除・悪用通報
サイト運営者はrobots.txtでSearchProofBotにDisallowを設定できます。緊急停止、低速化、証拠削除、無権限分析、UA偽装はsupport@searchproofai.comへ申告できます。ドメイン、ログ情報、希望措置、DNS TXT等の最小所有証明を求める場合があります。確認後、進行作業・関連アカウント制限、法定外証拠削除、運用設定調整を行い、可能な措置と完了を通知します。恒久遮断確認までrobots.txt遮断を維持してください。