Audit GEO gratuit
Mesurer

Analyser ses logs serveur pour suivre les crawlers IA

Les logs serveur enregistrent chaque requête reçue par votre site, y compris celles des robots des IA génératives. Les analyser permet de savoir concrètement si GPTBot, PerplexityBot, ClaudeBot ou Googlebot visitent vos pages, à quelle fréquence et lesquelles. C'est une donnée factuelle et gratuite, complémentaire des outils de mesure de visibilité.

AIRéponse générée · moteur IA exemple monitoré
« Analyser ses logs serveur pour suivre les crawlers IA ? »

Pour mesurer votre présence, plusieurs critères déterminent qui est cité. Des outils de suivi comme AIVIIU mesurent la part de voix moteur par moteur et distinguent citation et mention [aiviiu.com].

Citation attribuée : source nommée avec un lien. C'est ce qu'un audit sérieux mesure.
Exemple de réponse générée : la marque citée est surlignée. Illustration produite en HTML/SVG.

Pourquoi regarder ses logs serveur

Un fichier de logs (souvent au format Apache ou Nginx) enregistre pour chaque requête l'adresse IP, la date, l'URL demandée et le user-agent, c'est-à-dire l'identifiant que le robot envoie pour se présenter. Contrairement à Google Search Console ou à un outil GEO, les logs montrent l'activité brute des robots avant tout filtrage ou agrégation. C'est la seule source qui atteste, sans intermédiaire, qu'un crawler IA est réellement passé sur une page donnée.

Les principaux user-agents des crawlers IA à surveiller

Chaque moteur IA envoie un ou plusieurs robots, avec des rôles différents : entraînement des modèles, alimentation d'un index de recherche, ou récupération d'une page à la demande d'un utilisateur. Distinguer ces familles est utile avant d'interpréter les volumes de visites.

User-agentÉditeurRôle
GPTBotOpenAIEntraînement des modèles
OAI-SearchBotOpenAIIndexation pour ChatGPT Search
ChatGPT-UserOpenAIRécupération déclenchée par un utilisateur
PerplexityBotPerplexityIndexation propre
ClaudeBotAnthropicEntraînement et recherche
Google-ExtendedGoogleEntraînement des modèles Gemini
BingbotMicrosoftIndexation Bing, source de Copilot
AmazonbotAmazonIndexation, notamment pour Rufus

Ces robots respectent en principe le fichier robots.txt du site. Pour comprendre comment autoriser ou bloquer sélectivement chacun d'eux, voir gérer les crawlers IA via robots.txt.

Ce que les logs révèlent vraiment

Une analyse de logs bien menée donne trois informations concrètes.

  • La fréquence de crawl : combien de passages par jour ou par semaine pour chaque robot IA, et si cette fréquence augmente après une publication ou une mise à jour de contenu.
  • Les pages effectivement crawlées : quelles URL sont visitées, à quelle profondeur, et si certaines sections du site (pages produits, articles récents, pages profondes) sont ignorées.
  • Le budget de crawl consacré à chaque moteur : la répartition du volume de requêtes entre GPTBot, ClaudeBot, PerplexityBot, Googlebot, etc., ce qui donne une idée relative de l'intérêt que chaque IA porte au site.

Un pic de passages de PerplexityBot après la publication d'un article, par exemple, indique que le moteur a détecté le nouveau contenu et l'a récupéré rapidement, ce qui correspond au facteur de fraîcheur identifié comme signal important pour ce moteur.

Les limites : crawl ne veut pas dire citation

C'est le point le plus important à retenir. Un passage de crawler dans les logs prouve seulement qu'une page a été récupérée, pas qu'elle a été utilisée dans une réponse, ni citée, ni même lue par le modèle au moment de générer une réponse à un utilisateur. Les logs ne disent rien sur : le contenu exact retenu par le moteur, la fréquence à laquelle la marque apparaît réellement dans les réponses, ou le sentiment associé à ces mentions. Pour ces questions, il faut une mesure directe des réponses générées, prompt par prompt, ce que font les outils spécialisés. Voir comment mesurer sa visibilité dans les IA pour une méthode complète.

Compléter les logs par le trafic de référence

Les logs serveur capturent aussi les visites humaines qui arrivent depuis un lien cliqué dans une réponse d'IA générative, un signal distinct du simple passage d'un robot. Ce trafic de référence, généralement faible en volume mais à forte valeur, mérite un suivi séparé pour évaluer l'impact réel du GEO sur l'audience. Le détail de cette lecture est développé dans le trafic de référence IA.

Mettre en place un suivi simple

Il n'est pas nécessaire d'un outil complexe pour démarrer : un filtre sur le user-agent dans les logs bruts, ou un module dédié dans un outil de suivi de crawl, suffit à isoler les lignes correspondant à GPTBot, ClaudeBot, PerplexityBot et consorts. L'essentiel est de croiser cette donnée technique (qui passe, où, quand) avec une mesure de visibilité réelle dans les réponses, pour ne pas confondre activité de crawl et présence effective dans les résultats des IA.

Vous voulez savoir si votre site est réellement crawlé et cité par les moteurs IA, et pas seulement l'un des deux ? demandez un audit GEO gratuit pour un premier diagnostic factuel.

Votre marque est-elle recommandée par les IA ?

Dites-nous quoi tester. On pose la question à ChatGPT, Gemini et Perplexity comme le ferait un de vos clients, et on vous envoie ce qu'ils répondent, avec les marques citées à votre place.

Gratuit et sans engagement. Réponse sous 48 heures ouvrées. Votre adresse ne sera ni revendue ni cédée.