Saltar al contenido principal
SearchProof AI
Volver al servicio
RASTREADOR Y RECOPILACIÓN DE DATOS

Guía del rastreador y recopilación de datos

Explica cómo SearchProofBot solicita sitios, qué guarda y cómo puede controlarlo el operador.

Fecha de entrada en vigor 10 de agosto de 2026Versión 2.3
Términos del servicioPolítica de privacidadPolítica de pagos y reembolsosGuía del rastreador y recopilación de datos

Información del operador

Nombre del servicio
SearchProof AI
Operador
PKL Labs
Número de registro mercantil
416-48-01278
Dirección comercial
135 Daeho-ro, Osan-si, Gyeonggi-do, Republic of Korea
Soporte y privacidad
support@searchproofai.com

1. Identidad y finalidad

El token es SearchProofBot y las solicitudes usan el User-Agent SearchProofBot/1.0 (+https://searchproofai.com/crawler-policy). Solo audita la visibilidad de dominios solicitados y aporta evidencia; no crea un índice general, perfiles publicitarios ni vende datos para entrenar IA.

2. Qui inicia y con qué autoridad

La recogida comienza al iniciar una auditoría o reejecutar un perfil. El usuario debe ser propietario/administrador o tener interés legítimo. Se investigarán análisis no autorizados; podrán detenerse trabajos/cuentas y pedirse pruebas de control.

3. Alcance y límites de páginas

  • Páginas HTML HTTP/HTTPS del mismo sitio sin inicio de sesión
  • Hasta 5 páginas gratis y 100 en análisis, con límites de intentos y cola
  • HTML estático primero; renderizador externo limitado solo si está configurado
  • El robot no aporta credenciales ni cookies de sesión ni envía formularios y bloquea IP privadas, localhost, metadatos, puertos riesgosos y tipos prohibidos. Sin embargo, una ruta de login/admin pública sin autenticación puede ser HTML candidato salvo bloqueo robots.txt; proteja recursos privados con autenticación y bloquee SearchProofBot expresamente si procede.

4. Descubrimiento y restricción al mismo sitio

Los candidatos proceden de URL inicial, Sitemaps de robots.txt, índices e internos. En cada URL/redirección se revalidan esquema, host, DNS/IP y mismo sitio. Se normalizan rastreo/duplicados y se omiten PDF, archivos, imágenes y ejecutables.

5. robots.txt y directivas de página

Antes de recoger se solicita /robots.txt y se aplican Disallow y Crawl-delay de SearchProofBot o *. La implementación no afirma cubrir toda prioridad Allow ni caché de errores de RFC 9309; para reglas complejas use Disallow explícito y canal de bloqueo. noindex, nofollow, canonical y X-Robots-Tag se registran como evidencia, no autorizan eludir acceso. Proteja recursos privados con autenticación.

User-agent: SearchProofBot
Disallow: /

# Or block a path
User-agent: SearchProofBot
Disallow: /private-area/

6. Frecuencia, tamaño y salvaguardas

  • Solicitudes secuenciales con al menos 250 ms; Crawl-delay hasta 2 s
  • Límites: conexión 10 s, solicitud 20 s, 5 redirecciones y respuesta 5 MiB
  • Revalidación DNS/IP y bloqueo de destinos privados, loopback, link-local, metadatos y riesgosos
  • Se detienen solicitudes al cancelar, alcanzar límites o ante fallos repetidos

7. Campos recogidos y guardados

Puede guardar URL solicitada/final, estado, tipo, tiempo, título, meta, idioma, canonical, robots, encabezados, texto visible, enlaces, alt, datos estructurados, hash, fecha, rendimiento y HTML de evidencia. Los resultados incluyen puntuaciones, reglas y URL. Solo se procesa dentro del límite y se omiten tipos no compatibles.

8. Datos no recogidos o no reutilizados

  • Credenciales, cookies de sesión, formularios, pagos o páginas privadas autenticadas
  • Extracción separada de datos incidentales para perfilado o listas de marketing
  • Venta del HTML como índice general, entrenamiento de modelos o producto de datos

9. Conservación, supresión y separación de IA

La evidencia HTML invitada se elimina diariamente al superar siete días, con posible demora breve por cola o reintentos. Análisis y capturas de cuenta duran hasta borrar la cuenta, separando registros legales; la eliminación individual se anunciará si se ofrece. Consultas/respuestas IA son una fase separada mediante Gabia AI Hub. La auditoría gratuita no llama IA y lo no conectado queda sin medir. La recogida independiente del proveedor no es SearchProofBot.

10. Bloqueo, ajuste, supresión y abuso

El operador puede usar Disallow para SearchProofBot. Parada urgente, menor ritmo, borrado, análisis no autorizado o suplantación pueden pedirse a support@searchproofai.com. Podrán solicitarse dominio, hora/IP/UA/URL, medida y prueba mínima como DNS TXT, correo admin o Search Console. Verificado, podrán limitarse trabajos/cuentas, borrarse evidencia no legal o ajustarse parámetros, comunicando medidas y resultado. Mantenga robots.txt hasta confirmar un bloqueo persistente.

Normas y políticas externas relacionadas

Los documentos enlazados pueden ser modificados por sus operadores y la legislación imperativa prevalece sobre este documento.

  • RFC 9309 Robots Exclusion Protocol
  • Política de privacidad
SearchProof AI
Términos del servicioPolítica de privacidadPolítica de pagos y reembolsosGuía del rastreador y recopilación de datos

© 2026 PKL Labs. Todos los derechos reservados.

Operador de SearchProof AI · N.º de registro mercantil 416-48-01278 · 135 Daeho-ro, Osan-si, Gyeonggi-do, Republic of Korea · support@searchproofai.com