Indexation & crawl : comment Google explore votre site
Le réflexe hebdomadaire : Search Console → Pages → « Explorée, actuellement non indexée ». Si vos pages business y traînent, Google les juge trop faibles — enrichissez-les avant d’en créer de nouvelles.
Avant de pouvoir classer une page, Google doit d’abord la découvrir puis la stocker. C’est tout l’enjeu du crawl et de l’indexation : si une page n’est pas indexée, elle n’existe tout simplement pas dans les résultats de recherche.
Crawl : comment Google découvre vos pages
Google utilise un robot, le Googlebot, qui parcourt le web en suivant les liens. Il découvre vos pages via :
- les liens internes entre vos pages (d’où l’importance du maillage) ;
- les liens externes pointant vers votre site ;
- votre sitemap.xml, qui liste les URL que vous souhaitez voir explorées.
Indexation : ce que Google retient
Une fois une page explorée, Google décide de l’indexer ou non. Toutes les pages ne sont pas indexées : contenu trop pauvre, doublons, pages techniques… Google fait le tri.
Les outils pour piloter l’indexation
- robots.txt : indique aux robots les zones à ne pas explorer.
- Balise meta robots (noindex) : empêche l’indexation d’une page précise.
- Sitemap.xml : facilite la découverte de vos pages importantes.
- Balise canonical : désigne la version de référence en cas de contenus similaires.
Les problèmes d’indexation les plus fréquents
- Pages bloquées par erreur dans le robots.txt ou en noindex.
- Contenus dupliqués qui diluent le signal.
- Pages orphelines, sans aucun lien interne pointant vers elles.
- Gaspillage du budget de crawl sur des pages sans valeur.
Comment vérifier l’indexation de son site
La Google Search Console est l’outil de référence : le rapport « Indexation des pages » liste les pages indexées et les raisons des exclusions, et l’outil « Inspection d’URL » permet de tester une page précise et de demander son indexation.
Le noindex oublié et les redirections ratées se jouent au lancement : voici notre protocole de bascule sans casse.
Notre protocole de mise en ligne →Budget de crawl : l’attention limitée de Google
Google n’explore pas votre site à l’infini : chaque domaine dispose d’un « budget de crawl » proportionnel à son autorité et à sa santé technique. Pages en erreur, redirections en chaîne, contenus dupliqués et URLs à paramètres gaspillent ce budget au détriment de vos pages importantes. Un site propre est un site que Google explore mieux — et classe plus vite.
Les nouveaux crawlers : l’IA explore aussi votre site
Googlebot n’est plus seul : GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot et les autres crawlers IA parcourent désormais le web pour alimenter leurs réponses. Les autoriser dans votre robots.txt, c’est exister dans les réponses de ChatGPT et Perplexity ; les bloquer, c’est en disparaître. Pour une entreprise en quête de visibilité, le calcul est vite fait — c’est tout l’enjeu du référencement IA (GEO).
Le réflexe : contrôler ce que Google voit vraiment
Search Console est votre tour de contrôle : le rapport « Pages » vous dit ce qui est indexé, exclu et pourquoi. Canonical inattendue, noindex oublié, sitemap obsolète : la moitié des problèmes d’indexation se détectent en dix minutes de lecture — encore faut-il regarder. Un audit rapide révèle souvent des pages entières invisibles depuis des mois.