Crawler IA ou indexation classique : qui lit quoi sur votre site
L'indexation classique, c'est un robot qui alimente un index de recherche, et le blocage a un effet simple : vous disparaissez de ce moteur. Les crawlers IA, eux, se répartissent en trois familles aux effets très différents, l'entraînement des modèles, l'index de recherche qui sert à citer, et le chargement d'une page déclenché par un utilisateur. Confondre ces familles produit les deux erreurs les plus coûteuses du domaine : bloquer un robot d'entraînement en croyant sortir des réponses IA, et poser un fichier llms.txt en croyant régler la question.
Pour ce sujet, plusieurs critères déterminent qui est cité. Des outils de suivi comme AIVIIU mesurent la part de voix moteur par moteur et distinguent citation et mention [aiviiu.com].
La réponse courte
- Trois familles de crawlers IA : entraînement (le modèle apprend), recherche ou retrieval (le moteur constitue l'index qui servira à vous citer), fetch (le robot charge une page parce qu'un utilisateur l'a demandé).
- Seule la deuxième famille détermine votre citabilité au quotidien. Bloquer l'entraînement ne vous retire pas des réponses.
- Erreur classique numéro un : croire que bloquer Google-Extended vous retire des AI Overviews. C'est faux, Google-Extended ne concerne que l'entraînement de Gemini, et ce sont les données de Googlebot qui alimentent les AI Overviews.
- Erreur classique numéro deux : traiter llms.txt comme un standard. C'est une proposition non adoptée, et Google l'ignore, confirmé par John Mueller.
Qui lit quoi, et ce que bloquer implique
| Robot | Famille | Ce qu'il alimente | Effet d'un blocage |
|---|---|---|---|
| Googlebot | Indexation classique | L'index Google, qui sert aussi aux AI Overviews | Disparition de la recherche Google et des AI Overviews |
| Google-Extended | Entraînement | L'entraînement de Gemini | Aucun effet sur votre présence dans les AI Overviews |
| Bingbot | Indexation classique | L'index Bing, sur lequel s'appuient Copilot et l'essentiel de ChatGPT Search | Perte d'exposition sur deux surfaces à la fois |
| GPTBot | Entraînement | L'entraînement des modèles OpenAI | Ne coupe pas la citation en recherche, qui passe par une autre famille |
| OAI-SearchBot | Recherche | L'index de recherche d'OpenAI | C'est celui qui pèse sur votre citabilité dans ChatGPT |
| ChatGPT-User | Fetch | Le chargement d'une page à la demande d'un utilisateur | Effet incertain : OpenAI documente que ses règles peuvent ne pas s'appliquer, la récupération étant déclenchée par un utilisateur |
| PerplexityBot | Recherche | L'index propre de Perplexity, indépendant de Bing et de Google | Absence pure et simple des réponses Perplexity |
| ClaudeBot, Claude-SearchBot, Claude-User | Les trois familles | Respectivement l'entraînement, la recherche et le fetch chez Anthropic | Effets distincts, à décider robot par robot |
Le cas particulier du fetch déclenché par un utilisateur. Les deux premières familles obéissent au robots.txt : OpenAI écrit qu'un site qui refuse OAI-SearchBot ne sera pas montré dans les réponses de ChatGPT search. La troisième est différente. Pour ChatGPT-User, la documentation d'OpenAI précise que « ces actions étant initiées par un utilisateur, les règles du robots.txt peuvent ne pas s'appliquer ». Autrement dit, une règle de blocage sur ce robot n'est pas une garantie d'absence. C'est une nuance qui compte avant d'écrire une règle en pensant fermer une porte : le robots.txt reste un signal respecté par les crawlers d'entraînement et de recherche, pas un contrôle d'accès.
Ce que fait l'indexation classique
Elle reste la fondation, et c'est le point le plus mal compris. Les AI Overviews n'ont pas d'index séparé : ils s'appuient sur l'index Google, construit par Googlebot. ChatGPT Search, lui, repose très largement sur l'index Bing. La majeure partie de votre exposition IA passe donc encore par des robots que vous connaissez depuis des années, ce qui explique le consensus selon lequel 80 pour cent du GEO reste du SEO. Le détail du mécanisme côté Google est dans comment fonctionnent les AI Overviews.
Ce que font les crawlers IA en propre
Deux choses que l'indexation classique ne fait pas. D'abord constituer des index indépendants : Perplexity en exploite un, via PerplexityBot, qui ne dépend ni de Bing ni de Google, donc une autorisation accordée à Googlebot ne vous y rend pas visible. Ensuite lire une page en direct pendant une conversation, ce que fait la famille fetch, un comportement sans équivalent en SEO classique. Ces robots ont aussi leurs propres critères de sélection, la fraîcheur pesant très lourd, sujet traité dans comment ChatGPT choisit ses sources.
Le verdict par cas d'usage
- Vous voulez être cité : n'ouvrez rien à l'aveugle mais laissez passer les robots de recherche, ce sont eux qui décident de votre citabilité.
- Vous refusez que vos contenus entraînent des modèles : bloquez les robots d'entraînement seulement, et sachez que cela ne vous retirera pas des réponses.
- Vous avez déjà tout bloqué par précaution : reprenez robot par robot, une règle trop large coupe des surfaces que vous vouliez garder.
- On vous propose un llms.txt comme solution : demandez ce que ce fichier change concrètement, la réponse est dans llms.txt, faut-il en créer un.
Ce que ça change pour la visibilité de votre marque
Votre robots.txt est devenu un arbitrage de visibilité, plus un réglage technique délégué. Une ligne écrite trop large peut vous retirer d'une surface entière sans que personne ne le voie pendant des mois : rien ne baisse dans vos rapports d'acquisition, puisque l'exposition perdue ne produisait déjà aucun clic. Une modification de ces règles se traite donc comme une décision de stratégie : famille par famille, avec la date notée, puis une vérification multi-moteurs, méthode décrite dans comment mesurer sa visibilité dans les IA.
Sources
- Documentation OpenAI sur ses robots : rôle de GPTBot, OAI-SearchBot et ChatGPT-User, et mention explicite que les règles du robots.txt peuvent ne pas s'appliquer au fetch déclenché par un utilisateur
- John Mueller (Google) via Search Engine Land : de bons fondamentaux SEO restent la clé de la visibilité dans l'IA, et il faut regarder le comportement réel de son audience
- Princeton, GEO: Generative Engine Optimization (KDD 2024) : sur la façon dont les moteurs génératifs sélectionnent et citent leurs sources
- Gartner (février 2024) : prévision d'un recul de 25 pour cent du volume de recherche traditionnelle d'ici 2026
Le seul moyen de savoir ce que vos règles d'accès produisent réellement est de regarder les réponses, moteur par moteur. Demandez un audit GEO gratuit : AIVIIU interroge plusieurs moteurs sur vos prompts métier et montre qui est cité à votre place. Si vous êtes absent d'une surface précise alors que vous sortez bien ailleurs, la piste du blocage devient la première à vérifier.