Fichier d'exploration
robots.txt indique aux robots ce qu'ils peuvent explorer. Une règle Disallow demande de ne pas parcourir un chemin ; elle ne remplace pas une directive noindex.
Votre sitemap peut proposer des pages que robots.txt demande à Googlebot de ne pas explorer. Comparez ces deux fichiers pour retrouver les URL concernées.
Ce contrôle porte sur l'exploration et ne confirme pas la présence de l'URL dans l'index d'un moteur.
Coût : 2 crédits par utilisation.
Indiquez l'adresse de votre site, par exemple https://exemple.com/, ou l'adresse d'un sitemap .xml ou .xml.gz à contrôler directement. Pour un site, l'outil cherche les sitemaps déclarés dans robots.txt, puis les adresses courantes si nécessaire. Il compare les URL trouvées aux règles de Googlebot et conserve leur source. Les pages elles-mêmes ne sont pas téléchargées.
Connexion requise pour lancer l'outil et sauvegarder le rapport.
Méthode
robots.txt indique aux robots ce qu'ils peuvent explorer. Une règle Disallow demande de ne pas parcourir un chemin ; elle ne remplace pas une directive noindex.
Le sitemap indique les URL que le site souhaite faire découvrir. Sa présence ne garantit pas l'indexation.
Pour chaque URL, le rapport indique la décision Googlebot, le sitemap source et la règle appliquée avec son numéro de ligne. Les URL d'une autre origine sont distinguées : elles dépendent de leur propre fichier robots.txt.
Un délai dépassé, un XML incomplet, un sitemap déclaré inaccessible ou une limite atteinte peuvent empêcher de conclure sur tout le périmètre. Les blocages déjà observés restent affichés ; aucun pourcentage global n'est calculé tant que des décisions manquent.
FAQ
Non. robots.txt agit surtout sur l'exploration. Un moteur peut déjà connaître une URL bloquée ; ce contrôle ne permet pas de savoir si elle figure dans son index.
Le sitemap propose au robot de découvrir une URL, tandis que robots.txt lui demande de ne pas l'explorer. Le contrôle vous aide à retrouver ces instructions contradictoires.
Le contrôle actuel teste Googlebot. Le verdict dépend donc des règles robots.txt applicables à ce robot.
Retrouvez ici les derniers rapports de cet outil sauvegardés dans votre compte.