1. Identidad y finalidad
El token es SearchProofBot y las solicitudes usan el User-Agent SearchProofBot/1.0 (+https://searchproofai.com/crawler-policy). Solo audita la visibilidad de dominios solicitados y aporta evidencia; no crea un índice general, perfiles publicitarios ni vende datos para entrenar IA.
2. Qui inicia y con qué autoridad
La recogida comienza al iniciar una auditoría o reejecutar un perfil. El usuario debe ser propietario/administrador o tener interés legítimo. Se investigarán análisis no autorizados; podrán detenerse trabajos/cuentas y pedirse pruebas de control.
3. Alcance y límites de páginas
- Páginas HTML HTTP/HTTPS del mismo sitio sin inicio de sesión
- Hasta 5 páginas gratis y 100 en análisis, con límites de intentos y cola
- HTML estático primero; renderizador externo limitado solo si está configurado
- El robot no aporta credenciales ni cookies de sesión ni envía formularios y bloquea IP privadas, localhost, metadatos, puertos riesgosos y tipos prohibidos. Sin embargo, una ruta de login/admin pública sin autenticación puede ser HTML candidato salvo bloqueo robots.txt; proteja recursos privados con autenticación y bloquee SearchProofBot expresamente si procede.
4. Descubrimiento y restricción al mismo sitio
Los candidatos proceden de URL inicial, Sitemaps de robots.txt, índices e internos. En cada URL/redirección se revalidan esquema, host, DNS/IP y mismo sitio. Se normalizan rastreo/duplicados y se omiten PDF, archivos, imágenes y ejecutables.
5. robots.txt y directivas de página
Antes de recoger se solicita /robots.txt y se aplican Disallow y Crawl-delay de SearchProofBot o *. La implementación no afirma cubrir toda prioridad Allow ni caché de errores de RFC 9309; para reglas complejas use Disallow explícito y canal de bloqueo. noindex, nofollow, canonical y X-Robots-Tag se registran como evidencia, no autorizan eludir acceso. Proteja recursos privados con autenticación.
User-agent: SearchProofBot
Disallow: /
# Or block a path
User-agent: SearchProofBot
Disallow: /private-area/6. Frecuencia, tamaño y salvaguardas
- Solicitudes secuenciales con al menos 250 ms; Crawl-delay hasta 2 s
- Límites: conexión 10 s, solicitud 20 s, 5 redirecciones y respuesta 5 MiB
- Revalidación DNS/IP y bloqueo de destinos privados, loopback, link-local, metadatos y riesgosos
- Se detienen solicitudes al cancelar, alcanzar límites o ante fallos repetidos
7. Campos recogidos y guardados
Puede guardar URL solicitada/final, estado, tipo, tiempo, título, meta, idioma, canonical, robots, encabezados, texto visible, enlaces, alt, datos estructurados, hash, fecha, rendimiento y HTML de evidencia. Los resultados incluyen puntuaciones, reglas y URL. Solo se procesa dentro del límite y se omiten tipos no compatibles.
8. Datos no recogidos o no reutilizados
- Credenciales, cookies de sesión, formularios, pagos o páginas privadas autenticadas
- Extracción separada de datos incidentales para perfilado o listas de marketing
- Venta del HTML como índice general, entrenamiento de modelos o producto de datos
9. Conservación, supresión y separación de IA
La evidencia HTML invitada se elimina diariamente al superar siete días, con posible demora breve por cola o reintentos. Análisis y capturas de cuenta duran hasta borrar la cuenta, separando registros legales; la eliminación individual se anunciará si se ofrece. Consultas/respuestas IA son una fase separada mediante Gabia AI Hub. La auditoría gratuita no llama IA y lo no conectado queda sin medir. La recogida independiente del proveedor no es SearchProofBot.
10. Bloqueo, ajuste, supresión y abuso
El operador puede usar Disallow para SearchProofBot. Parada urgente, menor ritmo, borrado, análisis no autorizado o suplantación pueden pedirse a support@searchproofai.com. Podrán solicitarse dominio, hora/IP/UA/URL, medida y prueba mínima como DNS TXT, correo admin o Search Console. Verificado, podrán limitarse trabajos/cuentas, borrarse evidencia no legal o ajustarse parámetros, comunicando medidas y resultado. Mantenga robots.txt hasta confirmar un bloqueo persistente.