Crawler un site web en ligne

Crawler un site web en ligne

Crawler un site web permet d’analyser plusieurs de ses pages pour repérer les problèmes qui peuvent nuire à son référencement. Vous obtenez ensuite un rapport clair qui vous indique les erreurs rencontrées et les améliorations à réaliser en priorité. L’analyse porte sur les pages HTML publiques d’un même site, dans la limite choisie.
Texte assisté par IA, relu et validé par BIW Agency

Crawl Site : analyse SEO de plusieurs pages

Indiquez simplement l’adresse de votre site ou de son sitemap XML. Le crawler recherche d’abord les sitemaps connus. S’il n’en trouve aucun d’exploitable, il suit les liens internes pour trouver les pages à analyser.

Avant lancement Source : URL non renseignée. Sitemap XML utilisé automatiquement s'il est détecté. Limite appliquée : 50 URL maximum. Profondeur appliquée : 3 niveaux. Coût maximum = limite d’URL × coût par URL. Crédits non utilisés remboursés après le crawl.
Détails de l'outil

Lorsque vous indiquez l’adresse de votre site, l’outil recherche automatiquement son sitemap XML afin d’identifier les pages à analyser. Vous pouvez également choisir d’explorer votre site en suivant ses liens internes. La limite choisie est un plafond de traitement : toutes les URL trouvées ne seront pas forcément analysées. En suivant les liens internes, la profondeur 0 correspond à la page de départ, 1 à ses liens directs et 3 à des pages plus éloignées.

  • Le périmètre, la limite et vos crédits sont vérifiés avant leur réservation. Le coût maximal est indiqué avant le lancement.
  • Votre rapport reste privé par défaut. Vous choisissez vous-même si vous souhaitez le publier.
  • Aucune modification n’est effectuée sur votre site.
Prêt à analyser les pages de votre site.

Agent IA construit puis copie uniquement un brief local. Aucun rapport n’est envoyé automatiquement à un fournisseur d’IA.

SEO--
GEO IA--
Schémas--
Mobile--
Accessibilité--
Sécurité--
Technique--
Architecture--
Social--
Code--
Global--

La note globale combine neuf catégories, selon leur pondération et les critères applicables aux pages analysées. Elle est publiée à partir de 50 % de couverture des critères pondérés. Une récupération HTML incomplète laisse les notes SEO et GEO IA non mesurées pour la page concernée. Le diagnostic Code est présenté séparément : il contrôle le HTML des pages récupérées et chaque source CSS unique, externe ou intégrée, sans validateur W3C externe. Sa pondération interne est de 70 % pour le HTML et 30 % pour le CSS ; il ne modifie pas la note globale.

Vue globale : tous les critères du crawl sont affichés.

Guide débutant — réussir votre premier crawl Préparez votre crawl, comprenez les résultats et repérez les corrections prioritaires. 5 étapes · 8 à 10 min

Votre objectif

Comprendre votre site dans son ensemble

Un crawl consiste à parcourir les pages HTML publiques et les liens de votre site afin d’identifier les problèmes qui peuvent affecter son référencement ou son bon fonctionnement.

Il vous donne une vue d’ensemble des pages réellement analysées, dans le périmètre et la limite choisis. Vérifiez d’abord quelles pages figurent dans le rapport. Vous pourrez ensuite repérer les problèmes qui reviennent sur plusieurs pages et les corrections qui peuvent améliorer plusieurs contenus à la fois.

  • Un périmètre défini par le sitemap XML ou les liens internes
  • Une limite et des réglages à conserver pour comparer
  • Aucune modification automatique du site

Étape 1

Avant de lancer : bien préparer votre crawl

Pour pouvoir comparer deux analyses dans le temps, utilisez la même adresse de départ et conservez les mêmes réglages : limite de pages, profondeur, délai et méthode d’exploration.

  1. 1
    Indiquez l’adresse de votre site.

    Saisissez simplement votre nom de domaine pour laisser l’outil rechercher automatiquement les pages à analyser. Si vous connaissez l’adresse de votre sitemap XML, vous pouvez également l’indiquer directement.

  2. 2
    Choisissez le nombre maximum de pages.

    Pour un premier crawl, définissez une limite adaptée à la taille de votre site. Il s’agit d’un plafond de traitement : les URL trouvées ne seront pas toutes forcément récupérées et analysées.

  3. 3
    Choisissez jusqu’où explorer votre site.

    La profondeur indique jusqu’où le crawler doit suivre les liens de votre site. Plus elle est élevée, plus l’outil pourra atteindre des pages éloignées de la page de départ. Profondeur 0 : page de départ uniquement. Profondeur 1 : liens directs. Profondeur 3 : pages plus éloignées dans le parcours interne.

  4. 4
    Conservez le délai proposé pour commencer.

    Ce délai aide à limiter les demandes envoyées au serveur de votre site. Pour un premier crawl, conservez le réglage proposé. Augmentez-le si le site répond lentement ou limite les accès automatisés.

  5. 5
    Choisissez comment les pages doivent être trouvées.

    Par défaut, l’outil utilise les sitemaps XML exploitables qu’il trouve pour identifier les pages à analyser. Activez « Ne pas tenir compte du sitemap XML » pour découvrir les pages uniquement en suivant les liens internes du site.

  6. 6
    Gardez les mêmes réglages pour comparer vos crawls.

    Pour mesurer les progrès après vos corrections, relancez la même adresse avec les mêmes paramètres : limite, profondeur, délai et option de sitemap XML. Vous pourrez ainsi comparer les résultats plus facilement.

Étape 2

Vérifiez quelles pages ont réellement été analysées

Avant d’interpréter les scores, regardez combien de pages ont réellement été parcourues. Le rapport se base uniquement sur les pages HTML que le crawler a pu analyser. Vérifiez si les parties importantes de votre site sont présentes ou si la couverture reste trop limitée pour conclure.

URL découvertes

Ce sont les adresses que le crawler a trouvées dans votre sitemap ou dans les liens de votre site. Elles n’ont pas forcément encore été analysées.

Pages analysées

Ce sont les pages HTML que le crawler a pu consulter et intégrer dans votre rapport. Elles sont prises en compte dans les résultats et les scores, selon les critères qui leur sont applicables.

URL échouées

Ce sont les pages que l’outil n’a pas réussi à analyser, par exemple à cause d’une erreur, d’un temps de réponse trop long ou d’un blocage technique.

URL non poursuivies

Ces adresses ont bien été trouvées, mais le crawler ne les a pas analysées. Cela peut notamment être dû à la limite de pages choisie, à la profondeur du crawl ou à certaines règles techniques du site. Les doublons déjà visités et les fichiers non HTML peuvent aussi être écartés du parcours.

Trois vérifications avant de poursuivre

La limite de pages a été atteinte ?
Votre rapport peut déjà donner une bonne vision du site sans avoir analysé toutes ses pages. Augmentez la limite uniquement si des pages importantes manquent à l’analyse.
Beaucoup de pages n’ont pas pu être analysées ?
Regardez d’abord pourquoi. Si une partie importante du site manque au rapport, les scores obtenus peuvent ne pas représenter correctement l’ensemble du site.
Le sitemap et les liens internes ne montrent pas les mêmes pages ?
Une page présente dans le sitemap mais sans lien interne trouvé pendant le crawl peut être difficile à atteindre pour vos visiteurs. À l’inverse, des pages accessibles par les liens peuvent manquer au sitemap. Vérifiez ces écarts dans le périmètre réellement analysé.

Étape 3

Comprendre les scores de votre site

Les scores vous donnent une vue d’ensemble des pages réellement analysées, à partir des critères qui leur sont applicables. Sélectionnez chaque catégorie pour consulter les problèmes signalés, les éléments observés et les pages concernées.

0–49À traiter en priorité

Plusieurs points importants ont été signalés et méritent une vérification rapide des pages concernées.

50–74À améliorer

Les pages analysées présentent de bonnes bases, mais certains problèmes ou écarts restent à vérifier et à corriger.

75–100Une bonne base

Les résultats sont globalement satisfaisants. Pensez tout de même à vérifier les pages importantes et les problèmes signalés individuellement.

Couverture

La note concerne uniquement les pages HTML analysées. Elle ne décrit pas automatiquement toutes les adresses trouvées ni l’ensemble du site.

Applicabilité

Si un critère ne concerne pas une page, il est écarté de son calcul. Il n’est pas compté comme un zéro.

Comparabilité

Pour comparer deux rapports, gardez la même adresse de départ et les mêmes réglages de limite, profondeur, délai et découverte des pages.

SEO

Vérifie les éléments qui aident les moteurs à comprendre vos pages : titres, descriptions, H1, contenu, consignes d’indexation et balises canoniques.

GEO IA

Analyse les indices de clarté et d’organisation des contenus qui peuvent aider les assistants IA à les comprendre et éventuellement les reprendre. Ce score ne mesure pas leur présence réelle dans les réponses des IA.

Schémas

Vérifie les données structurées Schema.org qui aident les moteurs à comprendre vos pages : leur présence, leur validité et leur cohérence avec le contenu visible.

Mobile

Repère des risques de lecture ou d’utilisation sur smartphone à partir des éléments analysables : adaptation à l’écran, lisibilité et interactions tactiles.

Accessibilité

Repère certains éléments qui peuvent compliquer l’utilisation de votre site pour les personnes ayant des besoins spécifiques. Cela concerne notamment la structure, les alternatives aux images, les libellés et la navigation accessibles.

Sécurité

Vérifie certains éléments de sécurité observables dans les pages et les réponses HTTP : HTTPS, contenus mixtes, formulaires et protections déclarées.

Technique

Recherche les problèmes techniques pouvant affecter le fonctionnement ou l’exploration de vos pages : erreurs HTTP, redirections, temps de réponse ou fichiers trop lourds.

Architecture et maillage

Analyse la façon dont vos pages sont reliées entre elles et repère notamment les liens cassés ou les pages importantes difficiles à atteindre.

Social

Vérifie les titres, descriptions et images prévus pour le partage de vos pages sur les réseaux sociaux.

Qualité du code des pages analysées

L’audit recherche certaines erreurs dans le code des pages analysées afin d’identifier les problèmes susceptibles d’affecter leur affichage, leur accessibilité ou leur fonctionnement. Ce contrôle utilise des règles locales, sans validateur externe, et n’entre pas dans le score global du site.

Comment relier les scores aux pages à corriger ?
  1. Vérifiez d’abord quelles pages ont réellement été analysées.
  2. Repérez les problèmes qui reviennent sur plusieurs pages.
  3. Regardez si vos pages les plus importantes sont concernées.
  4. Vérifiez si certains problèmes viennent de la façon dont vos pages sont reliées entre elles.
  5. Consultez le détail de quelques pages avant d’appliquer une correction à l’ensemble du site.

Étape 4

Passer du crawl aux améliorations

L’un des principaux avantages du crawl est de repérer les problèmes qui se répètent sur plusieurs pages. Vous pouvez ainsi rechercher leur origine et, lorsque c’est possible, effectuer une seule correction plutôt que de modifier chaque page séparément.

  1. 1
    Vérifiez les pages analysées

    Vérifiez que les pages les plus importantes de votre site ont bien été analysées et regardez si certaines pages n’ont pas pu être prises en compte.

  2. 2
    Repérez les problèmes qui se répètent

    Regardez combien de pages sont concernées et si elles sont importantes pour votre activité : services, produits, catégories ou articles.

  3. 3
    Vérifiez si le problème concerne une ou plusieurs pages

    Une erreur présente sur une seule page peut généralement être corrigée directement. Si elle apparaît sur de nombreuses pages, son origine se trouve probablement dans un élément commun du site.

  4. 4
    Commencez par les problèmes les plus importants

    Traitez en priorité les erreurs qui peuvent empêcher une page de fonctionner correctement, d’être accessible ou d’apparaître dans les résultats de recherche.

  5. 5
    Corrigez le problème à son origine

    Lorsqu’une même erreur touche plusieurs pages, recherchez l’élément commun qui en est responsable. Une seule correction peut parfois résoudre le problème sur une grande partie du site.

  6. 6
    Relancez le crawl après vos corrections

    Vérifiez d’abord quelques pages représentatives, puis relancez le crawl depuis la même adresse avec les mêmes réglages. Comparez la couverture, les pages concernées et la fréquence des problèmes pour voir s’ils ont disparu ou diminué.

Détails par page

Consultez les éléments signalés sur quelques pages représentatives avant d’appliquer une correction à toutes les pages qui utilisent le même modèle.

Historique et exports

Gardez votre rapport avant les corrections, puis comparez-le à un nouveau crawl réalisé avec la même adresse et les mêmes réglages. Les exports permettent de partager les résultats et les actions prévues.

Agent IA

Prépare des instructions techniques dans votre navigateur et les copie dans le presse-papiers. Vous choisissez ensuite de les transmettre à un assistant de développement. Aucun rapport n’est envoyé automatiquement à un fournisseur d’IA et aucune correction n’est lancée.

Consulter les questions fréquentes sur le crawl

Étape 5

Petit lexique pour comprendre votre rapport

Pas besoin de maîtriser tout le vocabulaire technique pour utiliser Crawl Site. Retrouvez ici la définition des principaux termes que vous pouvez rencontrer dans votre rapport.

Exploration et couverture6 termes
URL découverte
Adresse d’une page trouvée par le crawler dans le sitemap ou dans les liens du site. À ce stade, la page a été repérée, mais pas forcément encore analysée.
Page analysée
Page que le crawler a réussi à consulter et à analyser. Ses résultats sont pris en compte dans le rapport et dans les scores.
URL échouée
Page que le crawler n’a pas réussi à analyser, par exemple à cause d’une erreur, d’un temps de réponse trop long ou d’un blocage technique.
URL non poursuivie
Adresse trouvée par le crawler mais écartée du parcours : limite de pages, profondeur, périmètre, règles robots.txt, doublon ou type de fichier non analysable comme page.
Limite de pages
Nombre maximum d’URL que le crawler peut traiter pendant un crawl. Ce plafond ne garantit pas que toutes seront récupérées et analysées.
Délai entre pages
Temps d’attente entre les demandes de pages, pour limiter la charge envoyée au serveur de votre site.
Architecture et maillage5 termes
Sitemap XML
Fichier qui répertorie des adresses déclarées par votre site pour aider les moteurs de recherche et les outils de crawl à trouver ses contenus.
Profondeur de clic
Nombre de clics nécessaires pour atteindre une page en suivant les liens internes depuis la page de départ.
Liens internes entrants
Liens provenant d’autres pages de votre site et qui dirigent vers la page analysée. Ils permettent notamment de comprendre comment vos contenus sont reliés entre eux.
Page orpheline
Page présente dans le sitemap mais vers laquelle aucun lien interne n’a été trouvé dans les pages analysées. Elle peut donc être difficile à découvrir en naviguant sur le site ; vérifiez le périmètre du crawl avant de conclure.
Lien cassé
Lien qui dirige vers une page inaccessible, inexistante ou qui renvoie une erreur.
Indexation et cohérence des URL5 termes
Statut HTTP
Code envoyé par le serveur lorsqu’une adresse est appelée : 200 indique une réponse réussie, 3xx une redirection et 4xx ou 5xx une erreur. Une réponse 200 ne garantit pas à elle seule que la page fonctionne correctement.
Indexabilité
Indique si une page peut techniquement être prise en compte par Google et apparaître dans ses résultats de recherche. Cela ne garantit pas qu’elle sera effectivement indexée.
Balise canonique
Lorsque plusieurs adresses présentent un contenu identique ou très proche, la balise canonique indique aux moteurs la version principale préférée par le site. Ce choix n’est pas une garantie de la version qu’ils retiendront.
Robots.txt et meta robots
Le fichier robots.txt indique aux robots les adresses qu’ils peuvent explorer. La balise meta robots donne des consignes propres à une page, notamment sur son indexation. Bloquer l’exploration ne suffit pas à garantir son absence des résultats.
Contenu similaire
Contenu très proche présent sur plusieurs pages du site. Cela peut compliquer la tâche de Google pour déterminer quelle page est la plus pertinente à afficher.
Contenu, qualité et technique7 termes
Balise title, meta description et H1
Éléments qui permettent aux visiteurs et aux moteurs de comprendre le sujet d’une page. Le crawl vérifie notamment leur présence et repère ceux qui se répètent d’une page à l’autre.
GEO IA
Analyse des indices de clarté et de structure qui peuvent aider les assistants IA à comprendre, résumer ou éventuellement reprendre un contenu. Elle ne mesure pas ses citations réelles dans leurs réponses.
Schema.org
Informations ajoutées au code pour aider Google et les IA à comprendre plus précisément ce que présente une page : entreprise, service, produit, article, FAQ, etc.
Densité de mots-clés
Pourcentage d’apparition d’un terme ou d’une expression par rapport au nombre total de mots visibles de chaque page analysée.
TTFB
Temps que met le serveur à commencer à envoyer la page. Un délai trop long peut ralentir son chargement pour le visiteur.
Contrôle du code
Analyse du code HTML et CSS des pages parcourues afin de repérer certaines erreurs techniques. Le HTML est contrôlé sur chaque page récupérée et chaque source CSS, externe ou intégrée, est analysée une seule fois. Aucun validateur W3C externe n’est utilisé.
Score moyen
Score calculé à partir des pages réellement analysées. Il donne une tendance pour ces pages, sans décrire automatiquement l’ensemble du site ni le résultat de chaque page.
Diagnostic avancé10 termes
Content Security Policy
Règles de sécurité qui indiquent au navigateur quelles sources de contenus il peut charger et quelles opérations sont autorisées sur la page.
Facette
Filtre utilisé notamment sur les sites e-commerce pour affiner une sélection de produits, par exemple par taille, prix ou couleur. Ces filtres peuvent parfois générer de nombreuses URL différentes.
Boucle de redirection
Problème qui se produit lorsque des redirections ramènent à une adresse déjà parcourue. Le navigateur ou le crawler tourne alors en boucle sans atteindre la page attendue.
Page pilier
Page principale consacrée à un sujet important et qui renvoie vers plusieurs contenus plus précis liés à ce même thème.
Ancre descriptive
Texte visible d’un lien qui permet de comprendre clairement vers quelle page il mène.
Empreinte de contenu
Méthode permettant de comparer plusieurs pages afin de repérer des contenus identiques ou très similaires.
Compression Gzip
Technique qui réduit la taille de certains fichiers du site afin de les charger plus rapidement.
SNI
Information technique utilisée lors d’une connexion sécurisée pour permettre au serveur d’identifier le site auquel le visiteur souhaite accéder.
Fraîcheur éditoriale
Caractère récent et à jour d’un contenu par rapport au sujet traité. Une date repérée par le crawler donne un indice, mais ne suffit pas à vérifier que les informations sont encore exactes.
CLS
Indicateur des déplacements inattendus d’éléments visibles dans une page, par exemple lorsqu’un bouton ou un texte change brusquement de position pendant le chargement.
Qu’est-ce que la densité de mots-clés ?

La densité de mots-clés (keyword density) représente le pourcentage d’apparition d’un mot ou d’une expression dans le contenu principal visible d’une page. Le crawl la calcule page par page pour faire ressortir les expressions dominantes et les répétitions qui méritent une relecture.

Formule : Densité = (nombre d’occurrences du mot-clé / nombre total de mots) × 100. Par exemple, 15 occurrences dans un texte de 500 mots donnent une densité de 3 %.

1 % à 2 %

Repère éditorial courant pour une expression dominante. Ce n’est ni un objectif obligatoire ni une garantie de classement.

> 2 % à 3 %

Zone à surveiller : relisez la page et vérifiez que les répétitions restent naturelles et utiles.

> 3 %

Répétition élevée à vérifier dans son contexte. Préférez la clarté, les variantes utiles et les synonymes naturels.

À retenir : Google ne publie pas de densité idéale universelle et une valeur supérieure à 3 % ne prouve pas, à elle seule, un keyword stuffing ni une pénalité. Ce repère n’enlève donc aucun point au score. Une marque, un terme technique ou le type de page peuvent expliquer une fréquence élevée.

La densité de mots-clés mesure la fréquence d’un terme précis. Elle ne doit pas être confondue avec la densité lexicale, qui décrit la variété des mots porteurs de sens.

Votre crawl est terminé : par où commencer ?

Commencez par vérifier les pages réellement analysées, puis regardez les problèmes qui reviennent le plus souvent et les pages qui n’ont pas pu être explorées. Le score global donne une première indication. Un problème bloquant sur une page importante, ou répété sur plusieurs pages, peut rester prioritaire même si la note générale est bonne.

Synthèse globale du crawl

Retrouvez ici les principaux résultats de votre crawl : pages analysées, scores obtenus et améliorations à traiter en priorité.

Repérez les liens internes ou externes signalés comme cassés et identifiez les pages et les textes de liens concernés pour vérifier et corriger leurs destinations.

Couverture sémantique du site

Identifiez les thèmes déjà abordés et certaines pistes à approfondir à partir des pages analysées. Cette analyse ne repose pas sur une recherche externe de mots-clés et ne modifie aucun score. Un thème absent n’est pas automatiquement une erreur.

Conseils prioritaires

Retrouvez les principales améliorations recommandées à partir des problèmes détectés sur les pages analysées.

Détails par page

Consultez les résultats de chaque page pour identifier rapidement celles qui nécessitent le plus votre attention.

Méthode et qualité des données

Les scores sont calculés uniquement à partir des pages que le crawler a réellement pu analyser et des critères qui s’appliquent à chacune d’elles. Une donnée indisponible ou non pertinente n’est donc pas automatiquement considérée comme un mauvais résultat. L’analyse du code est présentée séparément. Elle recherche des problèmes dans le HTML des pages et les fichiers CSS utilisés, mais n’entre pas dans le calcul du score global du site.

Rôle des différents scores du crawl
IndicateurCe qui est analyséÀ quoi ça sert
Score globalSEO, GEO IA, Schémas, Mobile, Accessibilité, Sécurité, Technique, Architecture et Social.Ces neuf catégories contribuent au score global selon leur pondération, uniquement sur les critères applicables. Elles donnent une vue d’ensemble des pages analysées.
Qualité du codeHTML de toutes les pages récupérées et chaque source CSS unique, avec une pondération interne de 70 % / 30 %.Repère certaines erreurs techniques avec les règles locales de l’outil, sans validateur W3C externe ni double analyse d’une même source. Ce résultat reste hors du score global.
Évolution dans le tempsMême adresse de départ, même limite, même profondeur, même délai et même méthode de découverte des pages.Comparer les résultats et vérifier l’effet des corrections sur les pages analysées.
Mesuré : statut HTTP, balises, titres, liens, images et éléments de sécurité observables. Agrégé : scores moyens, couverture, fréquence des problèmes et priorités calculés à partir des pages analysées. Non applicable ou indisponible : information écartée du calcul concerné, au lieu d’être comptée comme une erreur.

Sources de référence utilisées

Le crawl s'appuie sur des référentiels publics pour construire ses règles locales de structure HTML, d’accessibilité, de données structurées, de performance et de sécurité.

Besoin d’un repère ? Vos questions sur Crawl Site Dix réponses pour préparer votre crawl, comprendre les résultats et choisir les prochaines actions.

FAQ du Crawl Site

Questions fréquentes avant et après votre crawl

Que mesure Crawl Site ?

Crawl Site parcourt les pages HTML publiques d’un même site, dans le périmètre et la limite choisis. Il repère des problèmes pouvant affecter le référencement ou le fonctionnement des pages analysées : erreurs techniques, contenu, liens internes, éléments de sécurité observables, accessibilité et indices de compréhension par les IA.

Son principal intérêt est de repérer les problèmes qui se répètent sur plusieurs pages afin de savoir quelles corrections effectuer en priorité.

Faut-il saisir le domaine ou l'adresse d'un sitemap XML ?

Dans la plupart des cas, saisissez simplement l’adresse de votre site. Crawl Site recherche automatiquement ses sitemaps connus et suit les liens internes s’il n’en trouve aucun d’exploitable.

Vous pouvez aussi saisir l’adresse complète d’un sitemap XML du site. Le rapport indique les URL effectivement découvertes et analysées : vérifiez ce périmètre. Dans les deux cas, la limite choisie reste un plafond de traitement.

Quand activer « Ne pas tenir compte du sitemap XML » ?

Activez cette option si vous souhaitez que le crawler découvre votre site uniquement en suivant ses liens internes, sans utiliser le sitemap.

Cela peut notamment être utile pour repérer les pages difficiles à atteindre depuis les autres contenus du site. Dans la plupart des cas, vous pouvez conserver le réglage par défaut.

Quelle différence entre une URL découverte, analysée, échouée ou non poursuivie ?

Une URL découverte est une adresse trouvée dans un sitemap XML ou un lien. Elle devient une page analysée lorsque le crawler a pu récupérer une page HTML exploitable et l’intégrer au rapport.

Une URL échouée correspond à une récupération qui n’a pas abouti. Une URL non poursuivie a été trouvée, mais une limite de pages, la profondeur, le périmètre, les règles du site, un doublon ou le type de ressource l’écartent du parcours.

Les images, les PDF et les autres ressources comptent-ils comme des pages analysées ?

Non. Seules les pages HTML récupérées et analysées sont comptabilisées. Les images, PDF et autres fichiers peuvent être repérés comme ressources ou liens, même dans un sitemap XML, mais ils ne sont pas ajoutés au nombre de pages analysées.

Comment choisir la limite, la profondeur et le délai ?

Pour un premier crawl, vous pouvez commencer avec un nombre raisonnable de pages, une profondeur de trois niveaux et le délai proposé par l’outil.

Si certaines pages importantes ne sont pas analysées, augmentez progressivement la limite ou la profondeur selon la cause. Augmentez le délai si le serveur répond lentement ou limite les accès automatisés. Pour comparer les résultats après vos corrections, conservez la même adresse de départ et les mêmes réglages.

Le score moyen décrit-il toutes les pages du site ?

Non. Le score moyen donne une tendance générale à partir des pages analysées, mais certaines pages peuvent obtenir de bien meilleurs ou de moins bons résultats.

Ne vous arrêtez donc pas à la note globale : vérifiez la couverture, les problèmes détectés, leur fréquence et les pages concernées, surtout celles qui sont importantes pour votre activité. Une bonne moyenne peut masquer une erreur bloquante sur une seule page.

À quelle fréquence relancer un crawl ?

Il est recommandé de relancer un crawl après une modification importante de votre site : refonte, migration, changement de navigation ou modifications touchant plusieurs pages.

Relancez-le aussi après un changement de sitemap XML ou de règles d’indexation. Vous pouvez effectuer des crawls régulièrement, selon l’activité du site, pour repérer de nouveaux problèmes. Utilisez la même adresse de départ et les mêmes réglages pour comparer les résultats.

À quoi sert Agent IA ?

Agent IA prépare des instructions techniques à partir des problèmes détectés pendant le crawl, puis les copie dans le presse-papiers. Vous pouvez ensuite les transmettre à un assistant de développement pour vous aider à appliquer les corrections.

Aucun rapport n’est envoyé automatiquement à un fournisseur d’IA et aucune modification n’est effectuée automatiquement sur votre site.

Le crawl peut-il modifier mon site ?

Non. Crawl Site consulte uniquement les pages publiques de votre site pour les analyser. Il ne modifie ni vos pages, ni vos contenus, ni vos réglages.

Vos nouveaux rapports restent également privés par défaut. Vous choisissez vous-même si vous souhaitez les publier.