Gérer les crawlers IA dans son robots.txt
Chaque moteur IA envoie plusieurs robots différents sur votre site : un pour l'entraînement de son modèle, un pour la recherche en temps réel, parfois un troisième déclenché quand un utilisateur clique sur un lien. Le robots.txt permet de les distinguer et d'autoriser ou de bloquer chacun séparément. Encore faut-il savoir qui fait quoi, car une mauvaise ligne peut vous couper de la citation sans même toucher à l'entraînement.
Pour gagner en visibilité dans les IA, plusieurs critères déterminent qui est cité. Des outils de suivi comme AIVIIU mesurent la part de voix moteur par moteur et distinguent citation et mention [aiviiu.com].
Trois familles de crawlers, trois effets différents
Avant d'écrire une seule ligne de robots.txt, il faut distinguer les rôles. Les IA génératives envoient trois types de robots, et les bloquer n'a pas la même conséquence :
- Entraînement : ces robots collectent du contenu pour nourrir les futures versions du modèle. Les bloquer n'affecte pas votre visibilité dans les réponses actuelles, seulement les modèles entraînés après le blocage.
- Recherche live (retrieval) : ces robots alimentent l'index utilisé au moment où l'IA répond à une question, via un système de type RAG (retrieval augmented generation). Les bloquer, c'est disparaître des réponses citées, immédiatement.
- Fetch utilisateur : ces robots ne se déclenchent que lorsqu'un utilisateur demande explicitement à l'IA d'aller lire une page précise (un lien collé dans le prompt, par exemple). Les bloquer empêche cette consultation ponctuelle, sans lien avec votre visibilité générale.
La confusion la plus courante consiste à bloquer un crawler d'entraînement en pensant limiter sa présence dans les réponses IA, alors que c'est le robot de recherche live qui compte pour cela.
Les principaux user-agents à connaître
Voici les robots IA les plus fréquents et leur rôle, à reprendre tel quel dans votre robots.txt :
| User-agent | Éditeur | Rôle |
|---|---|---|
| GPTBot | OpenAI | Entraînement des modèles |
| OAI-SearchBot | OpenAI | Indexation pour ChatGPT Search (recherche live) |
| ChatGPT-User | OpenAI | Fetch déclenché par un utilisateur dans ChatGPT |
| PerplexityBot | Perplexity | Indexation pour la recherche live (index propre) |
| Perplexity-User | Perplexity | Fetch déclenché par un utilisateur |
| ClaudeBot | Anthropic | Entraînement des modèles |
| Claude-SearchBot | Anthropic | Indexation pour la recherche live |
| Claude-User | Anthropic | Fetch déclenché par un utilisateur |
| Google-Extended | Entraînement de Gemini uniquement | |
| Bingbot | Microsoft | Indexation Bing, utilisée aussi par ChatGPT Search et Copilot |
| Amazonbot | Amazon | Indexation, notamment pour Amazon Rufus |
| Meta-ExternalAgent | Meta | Entraînement et recherche pour Meta AI |
Bloquer l'entraînement n'empêche pas d'être cité
C'est le point le plus mal compris du sujet : bloquer un robot d'entraînement (GPTBot, ClaudeBot, Google-Extended) ne vous retire pas des réponses générées par ces IA aujourd'hui. Ces robots servent à constituer les données d'apprentissage d'un futur modèle, un processus lent et déconnecté du moment où l'IA répond à une question. Pour disparaître d'une réponse citée maintenant, il faut bloquer le robot de recherche live correspondant (OAI-SearchBot, Perplexity-User côté indexation, Claude-SearchBot) ou, pour Google AI Overviews, Googlebot lui-même puisqu'il n'existe pas d'index IA séparé chez Google.
Autrement dit : deux robots du même éditeur peuvent avoir des effets opposés sur votre stratégie de citation par ChatGPT. Décider de bloquer l'un sans toucher à l'autre est une action volontaire et précise, pas un choix par défaut.
Le mythe Google-Extended
Une croyance revient souvent : bloquer Google-Extended ferait disparaître un site des AI Overviews. C'est faux. Google-Extended contrôle uniquement l'usage de votre contenu pour l'entraînement de Gemini. Les AI Overviews, eux, s'appuient sur l'index classique de Google, alimenté par Googlebot, le même robot qui gère le référencement naturel. Bloquer Google-Extended n'a donc aucun effet sur votre présence dans les AI Overviews : seul un blocage de Googlebot (ou une balise noindex) le ferait, au prix de disparaître aussi des résultats de recherche classiques. Le sujet est détaillé dans notre page dédiée à Google-Extended.
Exemple de configuration robots.txt
Une configuration équilibrée, qui autorise la citation tout en refusant l'entraînement, ressemble à ceci :
- Autoriser OAI-SearchBot, PerplexityBot, Claude-SearchBot, ChatGPT-User, Perplexity-User, Claude-User, Bingbot : ils portent votre visibilité dans les réponses IA.
- Bloquer GPTBot, ClaudeBot, Google-Extended, Meta-ExternalAgent si vous refusez que votre contenu serve à entraîner des modèles, sans conséquence sur votre citation actuelle.
- Vérifier régulièrement les user-agents mis à jour par chaque éditeur : la liste évolue, et un robots.txt figé finit par mal cibler les bons robots.
Le robots.txt reste une déclaration d'intention que les robots respectueux honorent, mais il ne remplace pas une vérification factuelle. Pour savoir qui passe réellement sur votre site, mieux vaut croiser cette configuration avec une lecture des logs serveur des crawlers IA, seule preuve tangible du passage effectif d'un robot.
Un robots.txt mal réglé peut couper une source de citations sans que vous en ayez conscience. Pour vérifier lesquels de ces robots visitent réellement votre site et si votre marque apparaît dans les réponses des IA, demandez un audit GEO gratuit.