GPTBot, ClaudeBot et PerplexityBot : définition

GPTBot, ClaudeBot et PerplexityBot sont les crawlers des principaux moteurs de recherche génératifs qui indexent le contenu web pour alimenter les réponses de ChatGPT, Claude et Perplexity.

30 mai 2026 · 3 min

Illustration des crawlers IA : GPTBot, ClaudeBot et PerplexityBot

GPTBot, ClaudeBot et PerplexityBot sont les agents de crawl (robots d'exploration web) déployés respectivement par OpenAI, Anthropic et Perplexity pour indexer le contenu du web ; ils obéissent au protocole standard robots.txt et leur accès détermine directement si votre contenu peut être cité dans les réponses de ChatGPT, Claude et Perplexity.

Pourquoi c'est important pour la visibilité IA

L'impact du blocage de ces crawlers sur la visibilité IA est binaire et mesuré : 0 citation si le crawler est bloqué, quelle que soit la qualité du contenu. C'est le critère G23 de la méthodologie LightSpot, noté en sévérité HIGH.

Chaque crawler est identifiable par son User-Agent dans robots.txt :

  • GPTBot (OpenAI) : user-agent GPTBot. Utilisé pour l'indexation en temps réel qui alimente ChatGPT avec accès web (mode « Browse with Bing »), ainsi que pour certains entraînements de modèles OpenAI.
  • ClaudeBot (Anthropic) : user-agent ClaudeBot. Utilisé par Anthropic pour le crawl web qui alimente Claude lorsqu'il accède à des sources en ligne.
  • PerplexityBot (Perplexity) : user-agent PerplexityBot. Utilisé par Perplexity pour indexer et mettre à jour sa base de connaissances web en temps réel — Perplexity étant un moteur de réponse basé quasi-exclusivement sur du RAG en temps réel.

Le contexte historique est important : en 2023-2024, lors du débat public sur l'utilisation des données web pour l'entraînement des modèles, de nombreux sites ont ajouté des directives Disallow: / pour GPTBot ou ClaudeBot dans leur robots.txt. Ce faisant, ils ont également bloqué l'indexation pour les réponses en temps réel — un effet non intentionnel pour la majorité d'entre eux. Ces directives restent en place sur de nombreux sites sans que leurs propriétaires en soient conscients.

Un point de contrôle supplémentaire : CCBot est le crawler de Common Crawl, une organisation à but non lucratif qui produit des snapshots du web utilisés comme données d'entraînement par de nombreux modèles de langage. Son blocage n'affecte pas les citations en temps réel, mais peut affecter la présence du contenu dans les modèles entraînés sur Common Crawl.

Exemple concret

Voici un extrait de robots.txt qui bloque les citations pour ChatGPT et Claude, mais autorise Perplexity :

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Allow: /

Pour autoriser tous les crawlers IA sur l'ensemble du site (paramètre recommandé si vous voulez être cité) :

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: CCBot
Allow: /

Note : si aucune directive n'est spécifiée pour un User-Agent dans robots.txt, le comportement par défaut est l'autorisation d'accès. Le problème concerne donc exclusivement les sites qui ont ajouté des directives Disallow explicites — souvent copiées depuis des guides publiés en 2023 lors du débat sur l'entraînement des modèles.

Pour le contexte complet, voir le guide complet du GEO.

Portrait de Nicolas Meridjen, Fondateur de LightSpot.ai — outil d'audit de visibilité IA (46 critères SEO + GEO)

Nicolas Meridjen

Fondateur de LightSpot.ai — outil d'audit de visibilité IA (46 critères SEO + GEO)

Je construis LightSpot.ai et j'analyse comment les moteurs de recherche IA (ChatGPT, Perplexity, Google AI Overviews) choisissent les sources qu'ils citent. J'écris sur le GEO et le SEO à partir de données d'audit réelles.

Sur le même thème