en

GPTBot, ClaudeBot et PerplexityBot : définition

GPTBot, ClaudeBot et PerplexityBot sont les crawlers qui indexent le web pour alimenter les réponses de ChatGPT, Claude et Perplexity.

· 3 min de lecture

Illustration des crawlers IA : GPTBot, ClaudeBot et PerplexityBot

GPTBot, ClaudeBot et PerplexityBot sont les agents de crawl (robots d'exploration web) déployés respectivement par OpenAI, Anthropic et Perplexity pour indexer le contenu du web ; ils obéissent au protocole standard robots.txt et leur accès détermine directement si votre contenu peut être cité dans les réponses de ChatGPT, Claude et Perplexity.

Pourquoi c'est important pour la visibilité IA

L'impact du blocage de ces crawlers sur la visibilité IA est binaire et mesuré : 0 citation si le crawler est bloqué, quelle que soit la qualité du contenu. C'est le critère G23 de la méthodologie LightSpot, noté en sévérité HIGH.

Chaque crawler est identifiable par son User-Agent dans robots.txt :

  • GPTBot (OpenAI) : user-agent GPTBot. Utilisé pour l'indexation en temps réel qui alimente ChatGPT avec accès web (mode « Browse with Bing »), ainsi que pour certains entraînements de modèles OpenAI.
  • ClaudeBot (Anthropic) : user-agent ClaudeBot. Utilisé par Anthropic pour le crawl web qui alimente Claude lorsqu'il accède à des sources en ligne.
  • PerplexityBot (Perplexity) : user-agent PerplexityBot. Utilisé par Perplexity pour indexer et mettre à jour sa base de connaissances web en temps réel — Perplexity étant un moteur de réponse basé quasi-exclusivement sur du RAG en temps réel.

Le contexte historique est important : en 2023-2024, lors du débat public sur l'utilisation des données web pour l'entraînement des modèles, de nombreux sites ont ajouté des directives Disallow: / pour GPTBot ou ClaudeBot dans leur robots.txt. Ce faisant, ils ont également bloqué l'indexation pour les réponses en temps réel — un effet non intentionnel pour la majorité d'entre eux. Ces directives restent en place sur de nombreux sites sans que leurs propriétaires en soient conscients.

Un point de contrôle supplémentaire : CCBot est le crawler de Common Crawl, une organisation à but non lucratif qui produit des snapshots du web utilisés comme données d'entraînement par de nombreux modèles de langage. Son blocage n'affecte pas les citations en temps réel, mais peut affecter la présence du contenu dans les modèles entraînés sur Common Crawl.

Exemple concret

Voici un extrait de robots.txt qui bloque les citations pour ChatGPT et Claude, mais autorise Perplexity :

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Allow: /

Pour autoriser tous les crawlers IA sur l'ensemble du site (paramètre recommandé si vous voulez être cité) :

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: CCBot
Allow: /

Note : si aucune directive n'est spécifiée pour un User-Agent dans robots.txt, le comportement par défaut est l'autorisation d'accès. Le problème concerne donc exclusivement les sites qui ont ajouté des directives Disallow explicites — souvent copiées depuis des guides publiés en 2023 lors du débat sur l'entraînement des modèles.

Pour le contexte complet, voir le guide complet du GEO.

FAQ

Que sont GPTBot, ClaudeBot et PerplexityBot ?
Ce sont les crawlers déployés respectivement par OpenAI, Anthropic et Perplexity pour indexer le contenu du web. Ils obéissent au protocole standard robots.txt et leur accès détermine directement si votre contenu peut être cité dans les réponses de ChatGPT, Claude et Perplexity. Chacun s'identifie par son user-agent : GPTBot, ClaudeBot, PerplexityBot.
Que se passe-t-il si je bloque ces crawlers ?
L'effet est binaire : zéro citation si le crawler est bloqué, quelle que soit la qualité du contenu. Aucune optimisation de structure ou de sources ne compense un blocage dans robots.txt. C'est le critère G23 de la méthodologie LightSpot, noté en sévérité haute.
Comment savoir si mon site bloque les crawlers IA ?
En vérifiant les directives présentes dans votre fichier robots.txt. Si aucune directive n'est spécifiée pour un user-agent donné, le comportement par défaut est l'autorisation d'accès. Le problème ne concerne donc que les sites ayant ajouté une directive Disallow explicite pour GPTBot, ClaudeBot ou PerplexityBot.
Pourquoi tant de sites bloquent-ils ces crawlers sans le savoir ?
À cause d'un héritage de 2023-2024. Lors du débat public sur l'utilisation des données web pour entraîner les modèles, de nombreux sites ont ajouté un Disallow: / pour GPTBot ou ClaudeBot, souvent en copiant des guides publiés à l'époque. Ce faisant, ils ont aussi bloqué l'indexation pour les réponses en temps réel — un effet non intentionnel pour la majorité d'entre eux, et des directives qui restent en place aujourd'hui.
Faut-il aussi autoriser CCBot ?
Oui, si vous voulez la portée la plus large. CCBot est le crawler de Common Crawl, une organisation à but non lucratif dont les snapshots du web servent de données d'entraînement à de nombreux modèles de langage. Le bloquer n'affecte pas les citations en temps réel, mais peut affecter la présence de votre contenu dans les modèles entraînés sur Common Crawl. L'autoriser fait donc partie du paramétrage recommandé, aux côtés de GPTBot, ClaudeBot et PerplexityBot.
Portrait de Nicolas Meridjen, Fondateur de LightSpot.ai — outil d'audit de visibilité IA (46 critères SEO + GEO)

Nicolas Meridjen

Fondateur de LightSpot.ai — outil d'audit de visibilité IA (46 critères SEO + GEO)

Je construis LightSpot.ai et j'analyse comment les moteurs de recherche IA (ChatGPT, Perplexity, Google AI Overviews) choisissent les sources qu'ils citent. J'écris sur le GEO et le SEO à partir de données d'audit réelles.

Sur le même thème