Aller au contenu principal
SearchProof AI
Retour au service
ROBOT ET COLLECTE DE DONNÉES

Guide du robot et de la collecte des données

Explique comment SearchProofBot interroge les sites, ce qui est conservé et comment l’opérateur peut le contrôler.

Date d’entrée en vigueur 10 août 2026Version 2.3
Conditions d’utilisationPolitique de confidentialitéPolitique de paiement et remboursementGuide du robot et de la collecte des données

Informations sur l’exploitant

Nom du service
SearchProof AI
Exploitant
PKL Labs
Numéro d’immatriculation
416-48-01278
Adresse professionnelle
135 Daeho-ro, Osan-si, Gyeonggi-do, Republic of Korea
Assistance et confidentialité
support@searchproofai.com

1. Identité et finalité

Le jeton est SearchProofBot et les requêtes utilisent le User-Agent SearchProofBot/1.0 (+https://searchproofai.com/crawler-policy). Il audite uniquement la visibilité des domaines demandés et fournit des preuves ; il ne crée pas d’index général, de profil publicitaire ni de jeu de données vendu pour entraîner l’IA.

2. Initiateur et autorité

La collecte commence lors d’un audit ou de la relance d’un profil. L’utilisateur doit posséder/administrer le site ou avoir un intérêt légitime. Les analyses non autorisées sont examinées ; tâches/comptes peuvent être arrêtés et une preuve de contrôle demandée.

3. Périmètre et limites de pages

  • Pages HTML HTTP/HTTPS du même site sans connexion
  • Jusqu’à 5 pages gratuites et 100 détaillées, avec limites de tentatives et file
  • HTML statique en priorité ; rendu externe limité seulement si configuré
  • Le robot ne fournit ni identifiants ni cookies de session, ne soumet pas de formulaire et bloque IP privées, localhost, métadonnées, ports risqués et types interdits. Toutefois, une route connexion/admin publique sans authentification peut être une candidate HTML sauf blocage robots.txt ; protégez les ressources privées par authentification et bloquez explicitement SearchProofBot si nécessaire.

4. Découverte et restriction au même site

Les candidats viennent de l’URL initiale, des Sitemaps de robots.txt, index et liens internes. À chaque URL/redirection, schéma, hôte, DNS/IP et même site sont revérifiés. Paramètres de suivi/doublons sont normalisés ; PDF, archives, images et exécutables sont ignorés.

5. robots.txt et directives de page

Avant collecte, /robots.txt est demandé et les Disallow et Crawl-delay de SearchProofBot ou * sont appliqués. L’implémentation ne prétend pas couvrir toutes priorités Allow ni règles de cache d’erreur RFC 9309 ; pour des règles complexes, utilisez un Disallow explicite et le canal de blocage. noindex, nofollow, canonical et X-Robots-Tag sont des preuves, pas une autorisation de contourner l’accès. Protégez les ressources privées par authentification.

User-agent: SearchProofBot
Disallow: /

# Or block a path
User-agent: SearchProofBot
Disallow: /private-area/

6. Fréquence, taille et protections

  • Requêtes séquentielles avec au moins 250 ms ; Crawl-delay jusqu’à 2 s
  • Limites : connexion 10 s, requête 20 s, 5 redirections et réponse 5 Mio
  • Revalidation DNS/IP et blocage des cibles privées, loopback, link-local, métadonnées et risquées
  • Les requêtes s’arrêtent en cas d’annulation, limite ou échecs répétés

7. Champs collectés et conservés

Peuvent être conservés URL demandée/finale, statut, type, temps, titre, méta, langue, canonical, robots, titres, texte visible, liens, alt, données structurées, empreinte, date, performance et HTML de preuve. Les résultats comprennent scores, preuves de règles et URL. Le corps n’est traité que dans la limite et les types non pris en charge sont ignorés.

8. Données non collectées ou non réutilisées

  • Identifiants, cookies de session, formulaires, paiements ou pages privées authentifiées
  • Extraction séparée de données incidentes pour profilage ou listes marketing
  • Vente du HTML comme index général, entraînement de modèle ou produit de données

9. Conservation, suppression et séparation de l’IA

La preuve HTML invitée est supprimée quotidiennement au-delà de sept jours, avec bref délai possible lié à la file ou aux nouvelles tentatives. Analyses et captures du compte restent jusqu’à suppression, archives légales isolées ; la suppression individuelle sera annoncée si disponible. Requêtes/réponses IA constituent une étape distincte via Gabia AI Hub. L’audit gratuit n’appelle pas l’IA et les canaux indisponibles sont non mesurés. La collecte indépendante du fournisseur n’est pas SearchProofBot.

10. Blocage, ajustement, suppression et abus

L’opérateur peut définir Disallow pour SearchProofBot. Arrêt urgent, ralentissement, suppression, analyse non autorisée ou usurpation peuvent être demandés à support@searchproofai.com. Domaine, heure/IP/UA/URL, mesure et preuve minimale comme DNS TXT, e-mail admin ou Search Console peuvent être requis. Après vérification, tâches/comptes peuvent être restreints, preuves non légales supprimées ou réglages ajustés, avec communication de l’action et du résultat. Maintenez robots.txt jusqu’à confirmation d’un blocage persistant.

Normes et politiques externes associées

Les documents liés peuvent être modifiés par leurs opérateurs et les règles impératives prévalent sur le présent document.

  • RFC 9309 Robots Exclusion Protocol
  • Politique de confidentialité
SearchProof AI
Conditions d’utilisationPolitique de confidentialitéPolitique de paiement et remboursementGuide du robot et de la collecte des données

© 2026 PKL Labs. Tous droits réservés.

Exploitant de SearchProof AI · N° d’immatriculation 416-48-01278 · 135 Daeho-ro, Osan-si, Gyeonggi-do, Republic of Korea · support@searchproofai.com