Parlons de votre projet
Parlons de votre projet
La technique GEO

robots.txt pour les IA : autoriser ou bloquer ?

La vraie question n’est pas « bloquer ou autoriser les IA », mais « bloquer quoi, pour quel objectif ». Un robots.txt mal pensé peut vous couper de ChatGPT ou Perplexity sans rien protéger, ou laisser aspirer votre contenu pour l’entraînement sans bénéfice de visibilité.

La décision stratégique

Comme détaillé dans notre guide des robots IA, séparez entraînement (GPTBot, ClaudeBot) et recherche (OAI-SearchBot, PerplexityBot). La position la plus courante : autoriser la recherche, bloquer l’entraînement.

# Bloquer l'entraînement
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Autoriser la recherche et la citation
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /
À retenir : aucune directive robots.txt n’est légalement contraignante. C’est une déclaration d’intention que les robots sérieux respectent — mais rien n’empêche techniquement un crawler de l’ignorer.
ScénarioDirectiveConséquence
Tout autoriserAucun Disallow IAVisibilité max, contenu réutilisable pour l’entraînement
Bloquer l’entraînementDisallow GPTBot/ClaudeBot, Allow *-SearchBotCitations possibles, contenu protégé de l’entraînement
Tout bloquerDisallow sur tous les user-agents IAInvisibilité totale dans les réponses IA

Le piège Google-Extended

Beaucoup bloquent Google-Extended en pensant sortir des AI Overviews. Erreur : les AI Overviews s’appuient sur l’index Googlebot, pas sur Google-Extended (qui ne concerne que l’entraînement de Gemini).

Le conseil SEO Design

Ne traitez pas votre robots.txt comme une décision one-shot. Documentez chaque directive et revoyez-la chaque trimestre : la liste des robots IA évolue vite.

Le robots.txt gère l’accès, pas la pertinence : le contenu doit rester lisible techniquement — voir crawlabilité et rendu. Chapitre technique, guide GEO, guide SEO technique.

Bloquer GPTBot fait-il baisser mon trafic ChatGPT ?

Non, si OAI-SearchBot reste accessible. GPTBot ne sert qu’à l’entraînement.

Le robots.txt empêche-t-il l’entraînement ?

Pour les acteurs qui le respectent (OpenAI, Anthropic). Aucune valeur contraignante face à un crawler qui l’ignore.

Un robots.txt par IA ?

Non : un seul fichier à la racine gère tous les user-agents via des blocs distincts.

Poursuivre ce chapitre

Les articles de « La technique GEO »

  1. 01GPTBot, PerplexityBot & co : les robots IA
  2. 02robots.txt pour les IA : autoriser ou bloquer ?
  3. 03Données structurées (schema) et GEO
  4. 04llms.txt : le vrai du faux
  5. 05Crawlabilité et rendu : être lisible par les IA

← Revenir au chapitre · Sommaire du guide GEO