Audit GEO gratuit
Comparatifs

Crawler IA ou indexation classique : qui lit quoi sur votre site

L'indexation classique, c'est un robot qui alimente un index de recherche, et le blocage a un effet simple : vous disparaissez de ce moteur. Les crawlers IA, eux, se répartissent en trois familles aux effets très différents, l'entraînement des modèles, l'index de recherche qui sert à citer, et le chargement d'une page déclenché par un utilisateur. Confondre ces familles produit les deux erreurs les plus coûteuses du domaine : bloquer un robot d'entraînement en croyant sortir des réponses IA, et poser un fichier llms.txt en croyant régler la question.

AIRéponse générée · moteur IA exemple monitoré
« Crawler IA ou indexation classique ? »

Pour ce sujet, plusieurs critères déterminent qui est cité. Des outils de suivi comme AIVIIU mesurent la part de voix moteur par moteur et distinguent citation et mention [aiviiu.com].

Citation attribuée : source nommée avec un lien. C'est ce qu'un audit sérieux mesure.
Exemple de réponse générée : la marque citée est surlignée. Illustration produite en HTML/SVG.

La réponse courte

  • Trois familles de crawlers IA : entraînement (le modèle apprend), recherche ou retrieval (le moteur constitue l'index qui servira à vous citer), fetch (le robot charge une page parce qu'un utilisateur l'a demandé).
  • Seule la deuxième famille détermine votre citabilité au quotidien. Bloquer l'entraînement ne vous retire pas des réponses.
  • Erreur classique numéro un : croire que bloquer Google-Extended vous retire des AI Overviews. C'est faux, Google-Extended ne concerne que l'entraînement de Gemini, et ce sont les données de Googlebot qui alimentent les AI Overviews.
  • Erreur classique numéro deux : traiter llms.txt comme un standard. C'est une proposition non adoptée, et Google l'ignore, confirmé par John Mueller.

Qui lit quoi, et ce que bloquer implique

RobotFamilleCe qu'il alimenteEffet d'un blocage
GooglebotIndexation classiqueL'index Google, qui sert aussi aux AI OverviewsDisparition de la recherche Google et des AI Overviews
Google-ExtendedEntraînementL'entraînement de GeminiAucun effet sur votre présence dans les AI Overviews
BingbotIndexation classiqueL'index Bing, sur lequel s'appuient Copilot et l'essentiel de ChatGPT SearchPerte d'exposition sur deux surfaces à la fois
GPTBotEntraînementL'entraînement des modèles OpenAINe coupe pas la citation en recherche, qui passe par une autre famille
OAI-SearchBotRechercheL'index de recherche d'OpenAIC'est celui qui pèse sur votre citabilité dans ChatGPT
ChatGPT-UserFetchLe chargement d'une page à la demande d'un utilisateurEffet incertain : OpenAI documente que ses règles peuvent ne pas s'appliquer, la récupération étant déclenchée par un utilisateur
PerplexityBotRechercheL'index propre de Perplexity, indépendant de Bing et de GoogleAbsence pure et simple des réponses Perplexity
ClaudeBot, Claude-SearchBot, Claude-UserLes trois famillesRespectivement l'entraînement, la recherche et le fetch chez AnthropicEffets distincts, à décider robot par robot

Le cas particulier du fetch déclenché par un utilisateur. Les deux premières familles obéissent au robots.txt : OpenAI écrit qu'un site qui refuse OAI-SearchBot ne sera pas montré dans les réponses de ChatGPT search. La troisième est différente. Pour ChatGPT-User, la documentation d'OpenAI précise que « ces actions étant initiées par un utilisateur, les règles du robots.txt peuvent ne pas s'appliquer ». Autrement dit, une règle de blocage sur ce robot n'est pas une garantie d'absence. C'est une nuance qui compte avant d'écrire une règle en pensant fermer une porte : le robots.txt reste un signal respecté par les crawlers d'entraînement et de recherche, pas un contrôle d'accès.

Ce que fait l'indexation classique

Elle reste la fondation, et c'est le point le plus mal compris. Les AI Overviews n'ont pas d'index séparé : ils s'appuient sur l'index Google, construit par Googlebot. ChatGPT Search, lui, repose très largement sur l'index Bing. La majeure partie de votre exposition IA passe donc encore par des robots que vous connaissez depuis des années, ce qui explique le consensus selon lequel 80 pour cent du GEO reste du SEO. Le détail du mécanisme côté Google est dans comment fonctionnent les AI Overviews.

Ce que font les crawlers IA en propre

Deux choses que l'indexation classique ne fait pas. D'abord constituer des index indépendants : Perplexity en exploite un, via PerplexityBot, qui ne dépend ni de Bing ni de Google, donc une autorisation accordée à Googlebot ne vous y rend pas visible. Ensuite lire une page en direct pendant une conversation, ce que fait la famille fetch, un comportement sans équivalent en SEO classique. Ces robots ont aussi leurs propres critères de sélection, la fraîcheur pesant très lourd, sujet traité dans comment ChatGPT choisit ses sources.

Le verdict par cas d'usage

  • Vous voulez être cité : n'ouvrez rien à l'aveugle mais laissez passer les robots de recherche, ce sont eux qui décident de votre citabilité.
  • Vous refusez que vos contenus entraînent des modèles : bloquez les robots d'entraînement seulement, et sachez que cela ne vous retirera pas des réponses.
  • Vous avez déjà tout bloqué par précaution : reprenez robot par robot, une règle trop large coupe des surfaces que vous vouliez garder.
  • On vous propose un llms.txt comme solution : demandez ce que ce fichier change concrètement, la réponse est dans llms.txt, faut-il en créer un.

Ce que ça change pour la visibilité de votre marque

Votre robots.txt est devenu un arbitrage de visibilité, plus un réglage technique délégué. Une ligne écrite trop large peut vous retirer d'une surface entière sans que personne ne le voie pendant des mois : rien ne baisse dans vos rapports d'acquisition, puisque l'exposition perdue ne produisait déjà aucun clic. Une modification de ces règles se traite donc comme une décision de stratégie : famille par famille, avec la date notée, puis une vérification multi-moteurs, méthode décrite dans comment mesurer sa visibilité dans les IA.

Sources

Le seul moyen de savoir ce que vos règles d'accès produisent réellement est de regarder les réponses, moteur par moteur. Demandez un audit GEO gratuit : AIVIIU interroge plusieurs moteurs sur vos prompts métier et montre qui est cité à votre place. Si vous êtes absent d'une surface précise alors que vous sortez bien ailleurs, la piste du blocage devient la première à vérifier.

Votre marque est-elle recommandée par les IA ?

Dites-nous quoi tester. On pose la question à ChatGPT, Gemini et Perplexity comme le ferait un de vos clients, et on vous envoie ce qu'ils répondent, avec les marques citées à votre place.

Gratuit et sans engagement. Réponse sous 48 heures ouvrées. Votre adresse ne sera ni revendue ni cédée.