1. 크롤러 신원과 목적
제품 토큰은 SearchProofBot이며 운영 요청의 User-Agent는 SearchProofBot/1.0 (+https://searchproofai.com/crawler-policy) 형식입니다. 크롤러는 이용자가 요청한 도메인의 검색·AI 노출 준비도를 진단하고 근거를 제공하기 위한 분석 전용이며, 범용 검색 색인 구축, 광고 프로파일링 또는 AI 모델 학습용 데이터셋 판매를 목적으로 하지 않습니다.
2. 실행 주체와 분석 권한
수집은 이용자가 도메인을 입력해 무료 진단·상세 분석을 시작하거나 저장된 프로필의 재분석이 실행될 때 시작됩니다. 이용자는 대상 사이트의 소유자·관리자이거나 정당한 업무상 이해관계가 있어야 합니다. 권한 없는 분석 신고가 접수되면 작업과 계정을 조사하고 필요한 경우 중지·제한하며, 도메인 소유권 확인 자료를 요청할 수 있습니다.
3. 접근 범위와 페이지 한도
- 별도 로그인 없이 인터넷에서 접근 가능한 같은 사이트의 HTTP·HTTPS HTML 페이지
- 무료 진단 최대 5페이지, 상세 분석 최대 100페이지. 오류 대비 시도 수와 발견 대기열에도 별도 상한 적용
- 정적 HTML을 우선하고 설정된 경우에만 제한된 외부 브라우저 렌더러 사용
- 크롤러는 인증정보·세션 쿠키를 제공하거나 폼을 제출하지 않으며, 사설 IP·localhost·클라우드 메타데이터·위험 포트·차단 파일 유형에는 접근하지 않습니다. 다만 인증 없이 공개된 로그인·관리자 경로는 robots.txt 등으로 차단되지 않으면 공개 HTML 후보에 포함될 수 있으므로 비공개 자원은 반드시 인증으로 보호하고 필요하면 SearchProofBot을 명시적으로 차단해야 합니다.
4. URL 발견과 동일 사이트 제한
시작 URL, robots.txt에 기재된 Sitemap, 사이트맵 인덱스와 방문한 HTML의 내부 링크에서 후보 URL을 발견합니다. 각 URL과 모든 리디렉션 단계에서 스킴, 호스트, DNS·IP 안전성을 다시 검사하고 대상과 같은 사이트인지 확인합니다. 추적 쿼리와 중복 URL을 정규화하고 PDF·압축파일·이미지·실행파일 등 분석 대상이 아닌 확장자는 건너뜁니다.
5. robots.txt와 페이지 지시
수집 전에 최상위 /robots.txt를 요청하고 SearchProofBot 또는 *에 적용되는 Disallow와 합리적인 Crawl-delay를 반영합니다. 현재 구현은 RFC 9309의 모든 Allow 우선순위·오류 캐시 의미를 완전 구현한다고 주장하지 않으며, 지원하지 않는 복잡한 규칙이 있으면 사이트 운영자는 명시적인 SearchProofBot Disallow와 공식 차단 요청을 함께 사용할 수 있습니다. noindex, nofollow, canonical 및 X-Robots-Tag는 우회 권한이 아니라 진단 근거로 기록합니다. robots.txt는 접근제어 수단이 아니므로 비공개 자원은 인증으로 보호해야 합니다.
User-agent: SearchProofBot
Disallow: /
# Or block a path
User-agent: SearchProofBot
Disallow: /private-area/6. 요청 빈도·용량·안전장치
- 사이트별 순차 요청과 기본 250ms 이상의 지연, robots Crawl-delay는 최대 2초 범위에서 반영
- 연결 10초, 요청 20초, 리디렉션 최대 5회, 응답 최대 5MiB의 기본 제한
- 각 리디렉션의 DNS·IP 재검증, 사설·루프백·링크로컬·메타데이터 주소와 위험 대상 차단
- 작업 취소, 한도 도달 또는 반복 오류 시 후속 요청 중단
7. 수집·저장하는 필드
요청·최종 URL, HTTP 상태, 콘텐츠 유형, 응답시간, 제목, 메타 설명, 언어, canonical, robots·X-Robots 지시, 제목 구조, 보이는 본문, 내부·외부 링크, 이미지 대체텍스트, 구조화 데이터, 콘텐츠 해시, 수집 시각, 성능 지표와 분석 재현용 HTML 증거를 저장할 수 있습니다. 결과에는 점수, 규칙 근거와 해당 URL이 포함됩니다. 응답 원문은 크기 한도 안에서만 처리하며 지원하지 않는 콘텐츠 유형은 건너뜁니다.
8. 수집하지 않거나 별도 이용하지 않는 데이터
- 로그인 자격증명, 세션 쿠키, 폼 제출, 결제정보 또는 인증을 요구하는 비공개 페이지
- 분석 목적에 불필요한 공개 페이지의 개인정보를 별도 추출·인물 프로파일링·마케팅 목록화하는 행위
- 수집 HTML을 범용 검색 인덱스, AI 기초모델 학습 데이터 또는 제3자 데이터 상품으로 판매하는 행위
9. 보존·삭제·AI 관측과의 구분
비회원 진단의 HTML 증거는 진단일부터 7일이 지난 자료를 일일 정리 작업으로 삭제하며 처리 적체나 삭제 재시도로 짧은 지연이 생길 수 있습니다. 계정에 저장된 분석, 스냅샷과 보고서는 계정 삭제 시까지 보관하고 법정 기록은 분리하며, 개별 분석 영구 삭제 기능은 제공될 때 별도 안내합니다. 상세 분석의 AI 질문·응답은 크롤링과 별도 단계로 Gabia AI Hub의 선택 모델에 전송될 수 있습니다. 무료 SEO 진단은 외부 AI를 호출하지 않으며 연결되지 않은 채널은 미측정으로 기록합니다. AI 공급자의 독립적인 웹 수집은 SearchProofBot 수집과 다릅니다.
10. 차단·속도 조정·삭제·악용 신고
사이트 운영자는 robots.txt에서 SearchProofBot에 Disallow를 설정할 수 있습니다. 긴급 중단, 더 느린 요청, 저장 증거 삭제, 무권한 분석 또는 User-Agent 위장 신고는 support@searchproofai.com로 요청할 수 있습니다. 도메인, 로그의 요청 시각·IP·User-Agent·URL, 원하는 조치와 DNS TXT·관리자 이메일·Search Console 등 최소한의 소유권 증거를 요청할 수 있습니다. 확인 후 진행 작업·관련 계정을 제한하고 법정 보관 대상이 아닌 증거를 삭제하거나 운영 설정을 조정할 수 있으며, 가능한 조치와 완료 결과를 알립니다. 영구 차단 조치가 확인될 때까지는 robots.txt 차단을 함께 유지해야 합니다.