Analyse précise des directives d'exploration

Analyseur robots.txt précis

Vérifiez votre fichier robots.txt et comprenez quelle règle s'applique à une URL. Vous pouvez analyser le fichier public, coller son contenu ou préparer un brouillon modifiable, avec un contrôle fondé sur la RFC 9309.

Texte assisté par IA, relu et validé par BIW Agency

Seul le fichier /robots.txt placé à la racine de chaque origine s'applique. Il contrôle principalement l'exploration, ne garantit pas la désindexation et ne protège aucun contenu confidentiel.

Valider un fichier robots.txt public

Coût : 2 crédits par utilisation, quel que soit le mode. Le contrôle n'apporte aucune modification au site.

Outils
Mode de contrôle

Le fichier applicable est toujours https://hôte/robots.txt. Un robots.txt situé dans /blog/, /fr/ ou un autre sous-dossier n'a pas cette fonction.

Vérifier un fichier existant

Le rapport vous aide à lire la réponse du serveur et le contenu du fichier : statut HTTP, redirections, type, taille, encodage, groupes, règles et extensions. Une directive Sitemap reste facultative ; son absence n'est pas une erreur.

ConformitéSyntaxe, groupes, encodage, taille et directives reconnues sont expliqués séparément.
DécisionPour l'URL testée, le rapport montre le groupe sélectionné, les règles qui correspondent et celle qui s'applique.
InterprétationLe rapport distingue les constats techniques, les risques SEO et les améliorations facultatives pour vous aider à décider quoi modifier.

Connexion requise pour lancer l'outil et sauvegarder le rapport.

Méthode

Comprendre les règles et les avertissements

Emplacement et portée

L'adresse est normalisée vers /robots.txt à la racine de l'origine. Le protocole, l'hôte et le port définissent sa portée ; un fichier dans un sous-dossier ne s'applique pas.

Réponse HTTP

Le rapport distingue le statut HTTP, les redirections, le type MIME et la taille du fichier. Un 404 signifie généralement qu'aucune restriction n'est publiée. Une erreur réseau, une réponse partielle ou une erreur 5xx empêche un verdict définitif. Les notes restent non calculées quand le contenu ne peut pas être évalué.

Format du fichier

Le contrôle examine l'encodage, le marqueur BOM, les caractères illisibles et les lignes trop longues. La RFC 9309 prévoit un fichier texte en UTF-8 ; Google limite son analyse à 500 Kio. Le rapport distingue les octets reçus et interprétés ; les règles hors limite ne sont pas présentées comme vérifiées.

Groupe applicable

Les groupes dont le User-Agent correspond exactement au jeton produit du robot, sans tenir compte de la casse, sont combinés. À défaut, le groupe * sert de repli ; il ne s'ajoute jamais à un groupe exact. Les variantes Googlebot acceptées par le profil Google sont signalées dans les diagnostics ; cette tolérance n’est pas étendue aux autres robots.

Règle gagnante

Le chemin et sa requête sont comparés en respectant la casse, * et le suffixe $. La correspondance la plus spécifique gagne ; Allow gagne à longueur équivalente.

Directives et extensions

User-agent, Allow et Disallow sont séparés des extensions. Sitemap est utile mais facultatif ; Crawl-delay, Host et Noindex sont signalés selon le moteur.

Risques et conseils

Le rapport sépare les erreurs de syntaxe, les risques de blocage SEO et les améliorations facultatives. Si vous bloquez volontairement une URL, ce blocage ne constitue pas en lui-même une erreur. Chaque note donne accès aux contrôles, aux déductions et aux éventuels plafonds. Ces notes n’évaluent pas l’indexation réelle.

Brouillon contrôlable

Vous pouvez modifier les règles générées. Avant de publier le fichier, testez des pages, des ressources, des paramètres et des dossiers représentatifs, pour chaque robot concerné.

Références : RFC 9309 — Robots Exclusion Protocol, spécification robots.txt de Google et documentation Bing Webmaster.

Questions fréquentes Comprendre et préparer votre fichier robots.txt Consultez les réponses pour comprendre le contrôle et ses limites.

FAQ

Questions fréquentes

robots.txt empêche-t-il l'indexation ?

Non. Il contrôle principalement l'exploration. Une URL bloquée peut rester connue d'un moteur si elle est découverte par un lien, un sitemap ou une source externe.

Où faut-il publier le fichier robots.txt ?

À la racine de chaque origine, sous la forme https://exemple.com/robots.txt. Un fichier placé dans un sous-dossier ne contrôle pas l'exploration du site.

Comment la règle applicable est-elle choisie ?

Les groupes dont le User-Agent correspond exactement au jeton produit du robot, sans tenir compte de la casse, sont combinés. À défaut, le groupe * sert de repli. Parmi les règles correspondantes, la plus spécifique gagne et Allow l'emporte sur Disallow à longueur équivalente.

Que signifient les réponses HTTP 404 et 5xx ?

Un 404 signifie généralement qu'aucune restriction robots.txt n'est publiée. Une erreur 5xx ou réseau est plus risquée : le comportement temporaire dépend du robot et de son éventuelle copie en cache.

Un sitemap est-il obligatoire dans robots.txt ?

Non. La directive Sitemap est utile mais facultative. Son absence n'est pas une erreur de syntaxe et ne doit pas être pénalisée comme telle.

robots.txt protège-t-il une page confidentielle ?

Non. Le fichier est public et ne constitue pas un contrôle d'accès. Utilisez une authentification ou une restriction serveur pour empêcher réellement l'accès.

Le fichier généré peut-il être publié tel quel ?

Relisez et testez le brouillon avant de le publier. Vous pouvez le modifier pour éviter de bloquer une section utile du site.