1. 爬虫身份与目的
产品令牌为 SearchProofBot,生产请求使用 User-Agent SearchProofBot/1.0 (+https://searchproofai.com/crawler-policy)。仅用于审计用户指定域名的搜索与 AI 可见性并提供证据,不用于构建通用搜索索引、广告画像或出售 AI 训练数据集。
2. 发起方与分析权限
用户输入域名发起免费/深度诊断或保存的配置重新运行时开始收集。用户须拥有/管理网站或具有正当业务利益。收到无授权分析举报后会调查,可停止任务、限制账户并要求域名控制证明。
3. 访问范围与页面限制
- 无需单独登录即可访问的同站 HTTP/HTTPS HTML 页面
- 免费最多 5 页、深度最多 100 页;尝试次数及发现队列另有限制
- 优先静态 HTML;仅配置后使用受限外部浏览器渲染器
- 爬虫不会提供凭据或会话 Cookie、不会提交表单,并阻止私有 IP、localhost、云元数据、危险端口及被屏蔽文件类型。但无需认证即可公开访问的登录或管理路径,如未被 robots.txt 阻止,可能作为公开 HTML 候选;私有资源必须用认证保护,并在需要时明确屏蔽 SearchProofBot。
4. URL 发现与同站限制
候选 URL 来自起始 URL、robots.txt 中的 Sitemap、站点地图索引及已访问 HTML 的内部链接。每个 URL 和重定向步骤均重新验证协议、主机、DNS/IP 安全及同站状态。规范化跟踪参数和重复 URL,跳过 PDF、压缩包、图片、可执行文件等。
5. robots.txt 与页面指令
收集前请求顶层 /robots.txt,应用 SearchProofBot 或 * 的 Disallow 及合理 Crawl-delay。当前实现不声称完整支持 RFC 9309 的全部 Allow 优先级和错误缓存规则;复杂规则应同时使用明确的 SearchProofBot Disallow 及官方屏蔽渠道。noindex、nofollow、canonical 和 X-Robots-Tag 作为诊断证据记录,不授权绕过访问控制。私有资源应以认证保护。
User-agent: SearchProofBot
Disallow: /
# Or block a path
User-agent: SearchProofBot
Disallow: /private-area/6. 请求频率、容量与安全措施
- 同站顺序请求,默认至少 250ms;robots Crawl-delay 最多应用至 2 秒
- 默认:连接 10 秒、请求 20 秒、重定向 5 次、响应 5MiB
- 每次重定向重新验证 DNS/IP,阻止私有、回环、链路本地、元数据及危险目标
- 取消、达到上限或重复错误时停止后续请求
7. 收集与存储字段
可存储请求/最终 URL、HTTP 状态、类型、响应时间、标题、元描述、语言、canonical、robots/X-Robots、标题结构、可见正文、链接、图片 alt、结构化数据、内容哈希、时间、性能及复现用 HTML 证据。结果含评分、规则证据和 URL。仅在大小限制内处理正文,跳过不支持类型。
8. 不收集或不另行使用的数据
- 登录凭据、会话 Cookie、表单提交、付款数据或需认证的私有页面
- 另行提取偶然出现的个人信息用于人物画像或营销名单
- 将收集的 HTML 作为通用搜索索引、基础模型训练集或第三方数据产品出售
9. 保存、删除及与 AI 观测的区分
访客 HTML 证据超过 7 天后由每日任务删除,积压或重试可能造成短暂延迟。账户中的分析、快照及报告保留至账户删除,法定记录隔离;单项永久删除功能如提供将另行说明。深度分析 AI 查询/回答属于独立阶段,可经 Gabia AI Hub 发送至所选模型。免费 SEO 不调用外部 AI;不可用渠道记为未测量。AI 提供商的独立网页收集与 SearchProofBot 不同。
10. 屏蔽、限速、删除与滥用举报
网站运营者可在 robots.txt 为 SearchProofBot 设置 Disallow。紧急停止、降速、证据删除、未授权分析或 User-Agent 冒充可向 support@searchproofai.com 申请。可能要求域名、日志时间/IP/User-Agent/URL、所需措施及 DNS TXT、管理员邮箱或 Search Console 等最低所有权证明。核验后可限制任务或相关账户、删除非法定证据或调整运行设置,并告知可行措施和完成结果。在确认长期屏蔽前应保持 robots.txt 屏蔽。