robots.txt pour les IA : autoriser ou bloquer ?
La vraie question n’est pas « bloquer ou autoriser les IA », mais « bloquer quoi, pour quel objectif ». Un robots.txt mal pensé peut vous couper de ChatGPT ou Perplexity sans rien protéger, ou laisser aspirer votre contenu pour l’entraînement sans bénéfice de visibilité.
La décision stratégique
Comme détaillé dans notre guide des robots IA, séparez entraînement (GPTBot, ClaudeBot) et recherche (OAI-SearchBot, PerplexityBot). La position la plus courante : autoriser la recherche, bloquer l’entraînement.
# Bloquer l'entraînement User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: Google-Extended Disallow: / # Autoriser la recherche et la citation User-agent: OAI-SearchBot Allow: / User-agent: Claude-SearchBot Allow: / User-agent: PerplexityBot Allow: /
| Scénario | Directive | Conséquence |
|---|---|---|
| Tout autoriser | Aucun Disallow IA | Visibilité max, contenu réutilisable pour l’entraînement |
| Bloquer l’entraînement | Disallow GPTBot/ClaudeBot, Allow *-SearchBot | Citations possibles, contenu protégé de l’entraînement |
| Tout bloquer | Disallow sur tous les user-agents IA | Invisibilité totale dans les réponses IA |
Le piège Google-Extended
Beaucoup bloquent Google-Extended en pensant sortir des AI Overviews. Erreur : les AI Overviews s’appuient sur l’index Googlebot, pas sur Google-Extended (qui ne concerne que l’entraînement de Gemini).
Ne traitez pas votre robots.txt comme une décision one-shot. Documentez chaque directive et revoyez-la chaque trimestre : la liste des robots IA évolue vite.
Le robots.txt gère l’accès, pas la pertinence : le contenu doit rester lisible techniquement — voir crawlabilité et rendu. Chapitre technique, guide GEO, guide SEO technique.
Bloquer GPTBot fait-il baisser mon trafic ChatGPT ?
Non, si OAI-SearchBot reste accessible. GPTBot ne sert qu’à l’entraînement.
Le robots.txt empêche-t-il l’entraînement ?
Pour les acteurs qui le respectent (OpenAI, Anthropic). Aucune valeur contraignante face à un crawler qui l’ignore.
Un robots.txt par IA ?
Non : un seul fichier à la racine gère tous les user-agents via des blocs distincts.
Poursuivre ce chapitre
Les articles de « La technique GEO »
- 01GPTBot, PerplexityBot & co : les robots IA
- 02robots.txt pour les IA : autoriser ou bloquer ?
- 03Données structurées (schema) et GEO
- 04llms.txt : le vrai du faux
- 05Crawlabilité et rendu : être lisible par les IA