1. Identité et finalité
Le jeton est SearchProofBot et les requêtes utilisent le User-Agent SearchProofBot/1.0 (+https://searchproofai.com/crawler-policy). Il audite uniquement la visibilité des domaines demandés et fournit des preuves ; il ne crée pas d’index général, de profil publicitaire ni de jeu de données vendu pour entraîner l’IA.
2. Initiateur et autorité
La collecte commence lors d’un audit ou de la relance d’un profil. L’utilisateur doit posséder/administrer le site ou avoir un intérêt légitime. Les analyses non autorisées sont examinées ; tâches/comptes peuvent être arrêtés et une preuve de contrôle demandée.
3. Périmètre et limites de pages
- Pages HTML HTTP/HTTPS du même site sans connexion
- Jusqu’à 5 pages gratuites et 100 détaillées, avec limites de tentatives et file
- HTML statique en priorité ; rendu externe limité seulement si configuré
- Le robot ne fournit ni identifiants ni cookies de session, ne soumet pas de formulaire et bloque IP privées, localhost, métadonnées, ports risqués et types interdits. Toutefois, une route connexion/admin publique sans authentification peut être une candidate HTML sauf blocage robots.txt ; protégez les ressources privées par authentification et bloquez explicitement SearchProofBot si nécessaire.
4. Découverte et restriction au même site
Les candidats viennent de l’URL initiale, des Sitemaps de robots.txt, index et liens internes. À chaque URL/redirection, schéma, hôte, DNS/IP et même site sont revérifiés. Paramètres de suivi/doublons sont normalisés ; PDF, archives, images et exécutables sont ignorés.
5. robots.txt et directives de page
Avant collecte, /robots.txt est demandé et les Disallow et Crawl-delay de SearchProofBot ou * sont appliqués. L’implémentation ne prétend pas couvrir toutes priorités Allow ni règles de cache d’erreur RFC 9309 ; pour des règles complexes, utilisez un Disallow explicite et le canal de blocage. noindex, nofollow, canonical et X-Robots-Tag sont des preuves, pas une autorisation de contourner l’accès. Protégez les ressources privées par authentification.
User-agent: SearchProofBot
Disallow: /
# Or block a path
User-agent: SearchProofBot
Disallow: /private-area/6. Fréquence, taille et protections
- Requêtes séquentielles avec au moins 250 ms ; Crawl-delay jusqu’à 2 s
- Limites : connexion 10 s, requête 20 s, 5 redirections et réponse 5 Mio
- Revalidation DNS/IP et blocage des cibles privées, loopback, link-local, métadonnées et risquées
- Les requêtes s’arrêtent en cas d’annulation, limite ou échecs répétés
7. Champs collectés et conservés
Peuvent être conservés URL demandée/finale, statut, type, temps, titre, méta, langue, canonical, robots, titres, texte visible, liens, alt, données structurées, empreinte, date, performance et HTML de preuve. Les résultats comprennent scores, preuves de règles et URL. Le corps n’est traité que dans la limite et les types non pris en charge sont ignorés.
8. Données non collectées ou non réutilisées
- Identifiants, cookies de session, formulaires, paiements ou pages privées authentifiées
- Extraction séparée de données incidentes pour profilage ou listes marketing
- Vente du HTML comme index général, entraînement de modèle ou produit de données
9. Conservation, suppression et séparation de l’IA
La preuve HTML invitée est supprimée quotidiennement au-delà de sept jours, avec bref délai possible lié à la file ou aux nouvelles tentatives. Analyses et captures du compte restent jusqu’à suppression, archives légales isolées ; la suppression individuelle sera annoncée si disponible. Requêtes/réponses IA constituent une étape distincte via Gabia AI Hub. L’audit gratuit n’appelle pas l’IA et les canaux indisponibles sont non mesurés. La collecte indépendante du fournisseur n’est pas SearchProofBot.
10. Blocage, ajustement, suppression et abus
L’opérateur peut définir Disallow pour SearchProofBot. Arrêt urgent, ralentissement, suppression, analyse non autorisée ou usurpation peuvent être demandés à support@searchproofai.com. Domaine, heure/IP/UA/URL, mesure et preuve minimale comme DNS TXT, e-mail admin ou Search Console peuvent être requis. Après vérification, tâches/comptes peuvent être restreints, preuves non légales supprimées ou réglages ajustés, avec communication de l’action et du résultat. Maintenez robots.txt jusqu’à confirmation d’un blocage persistant.