Crawler un site web en ligne

Crawler un site web en ligne

Crawler un site web en ligne permet de lancer un audit SEO complet d'un site, d'analyser toutes les pages d'un site ou d'un sitemap et de repérer les corrections prioritaires.

Audit SEO complet d'un site

Collez un domaine ou l'adresse complète d'un sitemap XML. Le crawler tente d'abord les sitemaps connus, puis bascule sur la découverte interne si aucun sitemap exploitable n'est trouvé.

Avant lancement Limite appliquée : 50 URL maximum. Profondeur appliquée : 3 niveaux. Coût maximum = limite d’URL × coût par URL. Crédits non utilisés remboursés après le crawl.
Détails de l'outil

Domaine : le sitemap est recherché automatiquement, sauf si l'option d'ignorance du sitemap est cochée. Sitemap XML : seules les URL du sitemap détecté sont utilisées, dans la limite appliquée à votre compte, sauf si vous forcez la découverte interne. Profondeur 0 = URL de départ, 1 = liens directs, 3 = exploration jusqu'aux pages plus éloignées.

  • Périmètre, limite et crédits sont vérifiés avant la réservation.
  • Le rapport personnel reste privé par défaut et sa publication publique est une action séparée.
  • Aucune modification n'est apportée au site analysé.
Prêt pour crawler le site URL par URL.
SEO--
GEO IA--
Schémas--
Mobile--
Accessibilité--
Sécurité--
Code--
Global--
Guide débutant — réussir votre premier Crawl Site Définir le périmètre, contrôler la couverture et corriger les problèmes répétés. 5 étapes · 8 à 10 min

Votre objectif

Comprendre le site comme un ensemble, pas additionner des notes

Le crawl transforme les pages HTML publiques qu’il peut parcourir en une carte du site : couverture, architecture, problèmes récurrents et URL concernées. Une bonne lecture commence par vérifier ce qui a réellement été analysé, puis cherche les corrections capables d’améliorer plusieurs pages à la fois.

  • Un périmètre défini par le sitemap ou les liens internes
  • Une limite et des réglages à conserver pour comparer
  • Aucune modification automatique du site

Étape 1

Avant de lancer : fixer un périmètre reproductible

Deux crawls ne sont comparables que s’ils partent de la même adresse avec la même limite, la même profondeur et la même méthode de découverte.

  1. 1
    Choisissez le bon point de départ.

    Saisissez le domaine pour rechercher automatiquement ses sitemaps, ou l’adresse complète d’un sitemap XML pour partir d’un inventaire précis.

  2. 2
    Définissez une limite de pages utile.

    Commencez par un échantillon représentatif. La limite est un plafond de traitement, pas une promesse que toutes les URL seront analysées.

  3. 3
    Réglez la profondeur selon votre objectif.

    Profondeur 0 : point de départ uniquement. Profondeur 1 : liens directs. Profondeur 3 : pages plus éloignées dans le parcours interne.

  4. 4
    Respectez le serveur avec le délai.

    Conservez le délai proposé pour un premier crawl. Augmentez-le si le site répond lentement ou protège fortement les accès automatisés.

  5. 5
    Décidez si le sitemap doit guider l’exploration.

    Laissez l’option décochée pour contrôler les URL déclarées. Activez « Ne pas tenir compte du sitemap » pour observer le parcours réellement accessible par les liens internes.

  6. 6
    Notez les réglages avant correction.

    Pour mesurer une évolution, relancez la même adresse avec la même limite, la même profondeur, le même délai et la même option de sitemap.

Étape 2

Contrôler la couverture avant de croire les moyennes

Le rapport décrit uniquement les pages HTML réellement récupérées. Commencez par comparer les compteurs pour savoir ce qui se trouve dans l’analyse et ce qui est resté hors parcours.

URL découvertes

Candidates repérées dans le sitemap ou dans les liens internes. Une découverte ne signifie pas encore que la page a été lue.

Pages analysées

Réponses HTML exploitables qui ont été récupérées, contrôlées et intégrées aux scores et aux tableaux du rapport.

URL échouées

Récupérations interrompues par une erreur HTTP, un délai dépassé, une protection, une réponse vide ou un autre blocage.

URL non poursuivies

Candidates arrêtées par la limite, la profondeur, le périmètre, robots.txt, un doublon déjà visité ou un type de ressource non analysable comme page.

Trois vérifications avant de poursuivre

Limite atteinte
Si le plafond est rempli, le rapport peut être représentatif sans être exhaustif. Augmentez la limite seulement si les zones manquantes sont utiles.
Échecs nombreux
Examinez leurs statuts et leurs causes avant d’interpréter le score moyen : une partie importante du site peut manquer.
Sitemap et maillage différents
Une URL déclarée mais jamais reliée peut être orpheline ; une URL reliée mais absente du sitemap peut révéler un inventaire incomplet.

Étape 3

Lire les scores avec l’architecture du site

Un score moyen résume les pages analysées : il peut cacher une erreur grave sur une page stratégique ou diluer un défaut présent sur tout un gabarit.

0–35Priorité forte

Plusieurs signaux importants demandent une vérification rapide des pages et des modèles concernés.

36–70À améliorer

La base existe, mais des écarts répétés ou des pages faibles restent à traiter.

71–100Base solide

Les contrôles sont globalement satisfaisants ; vérifiez tout de même les exceptions et les URL importantes.

SEO et métadonnées

Les titles, descriptions, H1, canonical et directives restent-ils cohérents d’une page à l’autre ?

GEO IA et contenu

Les pages expliquent-elles clairement leurs sujets avec des réponses, preuves, entités et structures réutilisables ?

Schémas

Les données Schema.org correspondent-elles réellement aux types de pages et restent-elles cohérentes à l’échelle du site ?

Mobile et accessibilité

Les gabarits restent-ils lisibles et utilisables sur petit écran, au clavier et avec les technologies d’assistance ?

Sécurité et code

Les pages et ressources partagent-elles des protections cohérentes et un balisage suffisamment robuste ?

Architecture et maillage

Les pages stratégiques sont-elles proches de l’accueil, suffisamment reliées et accessibles sans chaîne inutile ?

Comment relier les scores aux pages à corriger ?
  1. Vérifiez la couverture pour connaître la population réellement mesurée.
  2. Repérez la fréquence de chaque problème et les types de pages touchés.
  3. Identifiez les URL stratégiques concernées par un blocage, même si la moyenne reste élevée.
  4. Croisez profondeur, in-links et statut pour comprendre si le problème vient aussi de l’architecture.
  5. Ouvrez le détail par page avant de décider si une correction doit viser une URL, un gabarit ou une règle globale.

Étape 4

Transformer le crawl en plan d’action systémique

Le principal avantage d’un crawl est de retrouver la source commune d’un problème. Corriger le bon gabarit, composant ou réglage évite de reprendre chaque URL séparément.

  1. 1
    Valider la couverture

    Confirmez que les zones importantes sont présentes et que les échecs ne faussent pas la lecture.

  2. 2
    Regrouper les problèmes répétés

    Notez le nombre de pages touchées, leur type et leur importance : produit, catégorie, service, article ou page de confiance.

  3. 3
    Distinguer l’isolé du systémique

    Une erreur sur une URL appelle une correction locale ; la même erreur sur vingt pages indique souvent un gabarit, une règle ou une donnée partagée.

  4. 4
    Lever les blocages avant d’optimiser

    Traitez d’abord les erreurs HTTP, l’indexabilité, les canonical incohérentes, les directives robots et les liens internes cassés.

  5. 5
    Corriger à la bonne source

    Intervenez ensuite sur le modèle de page, le menu, le composant, le schéma, la feuille de style ou la configuration qui produit l’écart.

  6. 6
    Tester puis relancer à périmètre constant

    Vérifiez quelques pages représentatives, puis relancez le crawl avec les mêmes réglages et comparez couverture, fréquence et URL concernées.

Détails par page

Ouvrez les preuves de quelques URL représentatives avant de généraliser une correction à tout un modèle.

Historique et exports

Conservez l’état avant intervention et comparez un nouveau rapport produit avec le même périmètre. Les exports servent à partager un plan daté.

Agent IA

Copie un brief technique avec les problèmes récurrents, les pages concernées et les contrôles attendus. Il ne modifie rien automatiquement.

Ouvrir les réponses essentielles avant et après le crawl

Étape 5

Petit lexique, à ouvrir seulement si nécessaire

Vous n’avez pas besoin de mémoriser tous les termes. Ouvrez la famille liée au compteur, au tableau ou à la page que vous êtes en train d’examiner.

Exploration et couverture6 termes
URL découverte
Adresse candidate trouvée dans un sitemap ou un lien interne, avant tentative d’analyse.
Page analysée
Réponse HTML récupérée et contrôlée, intégrée aux résultats et aux scores du crawl.
URL échouée
Adresse dont la récupération n’a pas abouti à cause d’un statut, d’un délai, d’une protection ou d’une réponse inexploitable.
URL non poursuivie
Candidate arrêtée par une limite, une profondeur, un périmètre, robots.txt, un doublon ou un type de ressource exclu.
Limite de pages
Nombre maximal d’URL que le crawl peut traiter lors de cette exécution.
Délai entre pages
Pause entre deux récupérations pour limiter la charge envoyée au serveur analysé.
Architecture et maillage5 termes
Sitemap XML
Inventaire d’URL déclaré par le site pour aider les moteurs et les outils de crawl à trouver ses contenus.
Profondeur de clic
Nombre d’étapes nécessaires depuis le point de départ pour atteindre une page par les liens internes.
In-links
Liens internes entrants vers une page. Leur nombre aide à estimer sa place dans le maillage.
Page orpheline
Page connue par le sitemap mais absente du parcours de liens internes observé.
Lien cassé
Lien dont la cible répond par une erreur ou ne peut pas être récupérée correctement.
Indexation et cohérence des URL5 termes
Statut HTTP
Code de réponse d’une URL : 200 pour une page disponible, 3xx pour une redirection, 4xx ou 5xx pour une erreur.
Indexabilité
Capacité technique d’une page à être proposée à l’indexation : réponse correcte, directives compatibles et canonical cohérente.
Canonical
Adresse déclarée comme version officielle lorsque plusieurs URL peuvent présenter un contenu proche.
Robots.txt et meta robots
Directives qui encadrent l’exploration et l’indexation. Elles n’ont pas exactement le même rôle.
Contenu similaire
Proximité entre plusieurs pages pouvant signaler une duplication, une variante peu différenciée ou une cannibalisation.
Contenu, qualité et technique6 termes
Title, meta description et H1
Repères qui présentent le sujet d’une page aux moteurs et aux visiteurs. Le crawl recherche notamment les absences et duplications.
GEO IA
Capacité d’un contenu à être compris, résumé et cité correctement par des moteurs génératifs.
Schema.org
Données structurées qui précisent le type de page, ses entités et leurs relations.
TTFB
Temps nécessaire au serveur pour envoyer le premier octet de la réponse.
Validation W3C
Contrôle de la syntaxe HTML et CSS ; une erreur doit être reliée à son impact réel avant correction.
Score moyen
Résumé calculé sur les pages effectivement analysées. Il ne décrit pas automatiquement chaque URL du site.

Crawl terminé : commencez par les priorités

Consultez d'abord la couverture, les alertes récurrentes et les pages en échec. Le score global sert à orienter la lecture, mais il ne remplace pas l'impact réel d'un problème bloquant ou fréquent.

Synthèse globale du crawl

Vue d'ensemble du crawl du site : progression, couverture, moyennes et priorités de correction.

Liens internes ou externes cassés, pages sources, ancres concernées et cibles à corriger en priorité.

Couverture sémantique du site

Repère les dimensions déjà traitées et les pistes éventuellement absentes, sans recherche externe de mots-clés ni effet sur les scores.

Conseils prioritaires

Plan d'action global basé sur le crawl de toutes les pages analysées.

Détails par page

Résultats URL par URL pour prioriser les actions sans perdre de temps.

Méthode et qualité des données

Le crawl combine des données mesurées sur les pages lues, des contrôles HTML/CSS, Schema.org, sécurité, accessibilité, maillage interne et des indicateurs de performance quand ils sont disponibles.

Mesuré : statut HTTP, balises, titres, liens, images, sécurité. Estimé : notoriété, risque JS/CSS, priorisation globale. Indisponible : données terrain ou API absentes selon les URL.

Sources de référence utilisées

Le crawl s'appuie sur des référentiels publics pour comparer les pages analysées : validation HTML, CSS, données structurées, performance, sécurité et accessibilité.

Aide à la décision Questions rapides sur le crawl SEO, GEO IA et l’architecture du site Neuf réponses courtes pour choisir le périmètre, interpréter la couverture et décider de la suite.

Réponses essentielles

Les réponses essentielles avant et après votre crawl

Que mesure Crawl Site ?

Crawl Site explore les pages HTML publiques d'un même site pour mesurer la couverture, les erreurs techniques, les métadonnées, le maillage interne, la profondeur, le contenu, le GEO IA, les schémas, l'accessibilité, la sécurité et le code. Il met surtout en évidence les problèmes répétés et les pages concernées.

Faut-il saisir le domaine ou l'adresse d'un sitemap XML ?

Saisissez le domaine pour laisser l'outil rechercher les sitemaps connus puis utiliser la découverte interne si nécessaire. Saisissez l'adresse complète d'un sitemap XML lorsque vous voulez partir d'un inventaire précis. Dans les deux cas, la limite configurée reste appliquée.

Quand activer « Ne pas tenir compte du sitemap » ?

Activez cette option pour observer le parcours réellement accessible par les liens internes, notamment si le sitemap est incomplet ou contient des URL anciennes. Laissez-la désactivée pour contrôler en priorité les URL déclarées et repérer celles qui semblent orphelines.

Quelle différence entre une URL découverte, analysée, échouée ou non poursuivie ?

Une URL découverte est une candidate trouvée dans un sitemap ou un lien. Elle devient analysée lorsque sa page HTML a été récupérée et contrôlée. Elle est échouée si la récupération n'aboutit pas. Elle est non poursuivie lorsqu'une règle de périmètre, de profondeur, de limite ou de type de ressource arrête le parcours.

Les images, PDF et autres ressources comptent-ils comme des pages analysées ?

Non. Les cibles qui sont des images, PDF ou autres ressources non HTML ne sont pas traitées comme des pages, même lorsqu'elles apparaissent dans un sitemap. Elles peuvent être observées comme ressources ou liens, mais elles n'entrent pas dans le nombre de pages HTML analysées.

Comment choisir la limite, la profondeur et le délai ?

Commencez avec une limite représentative, une profondeur de trois niveaux et le délai proposé. Augmentez la limite si la couverture reste insuffisante, la profondeur si des pages utiles sont éloignées, et le délai si le serveur répond lentement. Gardez ensuite les mêmes réglages pour comparer deux crawls.

Le score moyen décrit-il toutes les pages du site ?

Non. Une moyenne résume uniquement les pages analysées et peut masquer une erreur bloquante sur une URL stratégique. Lisez-la avec la couverture, le nombre de pages touchées, la fréquence du problème, la profondeur et les détails URL par URL.

À quelle fréquence relancer un crawl ?

Relancez-le après une migration, une refonte, une modification de gabarit, de navigation, de sitemap ou de règles d'indexation, puis périodiquement selon l'activité du site. Utilisez la même URL de départ et les mêmes réglages pour suivre une évolution comparable.

À quoi sert Agent IA et le crawl modifie-t-il le site ?

Agent IA copie un brief technique pour un assistant de code à partir des problèmes et des pages concernés. Il ne lance aucune correction automatiquement. Le crawl lit le site public sans le modifier, et les nouveaux rapports restent privés tant que vous ne choisissez pas explicitement de les publier.