Fichier analysé
À partir de l'adresse saisie, l'outil recherche robots.txt. Il suit les redirections autorisées par le serveur et conserve l'adresse finale pour que vous sachiez quel fichier a été lu.
Indiquez une page de votre site pour lire les règles qui s’appliquent à son chemin : recherche IA, collecte pour l’entraînement ou consultation à la demande. L’outil récupère robots.txt à la racine du site et distingue ces usages.
Ce contrôle analyse uniquement robots.txt. Il ne confirme pas qu'un service IA visite, utilise, indexe ou cite le contenu.
Coût : 2 crédits par utilisation. Le contrôle porte sur le fichier robots.txt d'un site public et présente un résultat pour chaque identifiant de robot testé.
Connexion requise pour lancer l'outil et sauvegarder le rapport.
Retrouvez les rapports sauvegardés dans votre compte. Ils peuvent contenir les domaines analysés et les résultats de chaque robot. Vous pouvez les supprimer depuis cet historique.
Méthode
Il n’y a pas de note globale : un refus d’entraînement peut être volontaire. Les visites ChatGPT-User et Perplexity-User ont des limites particulières de prise en charge. Google-Extended est un jeton de contrôle d’usage, pas un robot HTTP distinct. Le rapport précise ces différences.
À partir de l'adresse saisie, l'outil recherche robots.txt. Il suit les redirections autorisées par le serveur et conserve l'adresse finale pour que vous sachiez quel fichier a été lu.
Les groupes correspondant exactement au jeton sont fusionnés. Sans groupe spécifique, le groupe général User-agent: * est utilisé. La règle correspondante la plus spécifique l’emporte ; Allow gagne à égalité.
Une règle Disallow: / peut comporter des exceptions Allow. Le verdict porte sur le chemin saisi, avec ses paramètres, et ne permet pas de conclure pour tous les chemins du site.
L'analyse décrit les restrictions du fichier public. Elle ne permet pas de savoir si une IA a visité le site, utilisé son contenu pour son entraînement ou cité une page.
FAQ
Non. Elle signifie seulement qu'aucune restriction correspondante n'a été détectée dans robots.txt pour l'identifiant contrôlé.
Pas toujours. Certaines directives bloquent uniquement des chemins précis. Dans ce cas, le verdict dépend de l'URL réellement étudiée.
Les noms des robots et leur prise en charge peuvent évoluer. La version de la liste utilisée figure donc dans le rapport pour situer le résultat.
Non. Le fichier est public et ne constitue pas un mécanisme de contrôle d'accès. Utilisez une authentification ou une restriction serveur.