Aller au contenu principal

robots.txt pour les bots IA : GPTBot, ClaudeBot, PerplexityBot et les autres

Le fichier robots.txt est le premier filtre que rencontrent les crawlers IA. Voici la configuration complète et à jour pour autoriser ou bloquer chaque bot en avril 2026.

Le fichier robots.txt est le premier filtre que rencontrent les crawlers IA quand ils visitent votre site. C'est aussi le point de blocage le plus fréquent : selon nos audits, 38 % des sites français bloquent involontairement au moins un crawler IA majeur, ce qui les rend invisibles pour ChatGPT, Perplexity ou Claude. Voici la configuration complète et à jour pour avril 2026.

Que regardent les crawlers IA dans le robots.txt ?

Les crawlers IA respectent globalement le standard robots.txt tel que défini par l'IETF (RFC 9309). Chacun a son user-agent spécifique, et chacun lit votre fichier robots.txt avant de crawler vos pages. Une règle Disallow qui matche leur user-agent les arrête net. Une règle Allow ou l'absence de Disallow les autorise.

Liste à jour des principaux bots IA en 2026

User-agentOpérateurUsageStatut 2026
GPTBotOpenAIEntraînement GPTActif
OAI-SearchBotOpenAIChatGPT Search en temps réelActif
ChatGPT-UserOpenAIAction utilisateur dans ChatGPTActif
ClaudeBotAnthropicIndexation pour ClaudeActif
anthropic-aiAnthropicVariante ClaudeLegacy
PerplexityBotPerplexityIndex PerplexityActif
Perplexity-UserPerplexityAction utilisateur PerplexityActif
Google-ExtendedGoogleEntraînement Gemini et AI OverviewsActif
BytespiderByteDanceDoubao, TikTok IAActif
CCBotCommon CrawlCorpus public utilisé par de nombreux LLMsActif
Meta-ExternalAgentMetaLlama, Meta AIActif
AmazonbotAmazonAlexa, Q BusinessActif
Applebot-ExtendedAppleApple IntelligenceActif

Configuration recommandée : tout autoriser

Pour un site qui veut maximiser sa visibilité IA, la règle est simple : tout autoriser sauf cas exceptionnels. Voici la configuration de référence :

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: Meta-ExternalAgent
Allow: /

Sitemap: https://votre-domaine.com/sitemap.xml

Astuce souvent oubliée : un Allow: / explicite est inutile au sens strict du standard, mais il sert de documentation et évite les ambiguïtés pour les futurs développeurs qui modifieraient le fichier.

Configuration restrictive : bloquer l'entraînement, autoriser le search

Certains sites veulent un compromis : autoriser les crawlers de search en temps réel (qui génèrent du trafic) mais bloquer les crawlers d'entraînement (qui ne donnent rien en retour). Voici comment faire :

# Autoriser le search en temps réel
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

# Bloquer l'entraînement
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: anthropic-ai
Disallow: /

Attention : bloquer GPTBot tout en autorisant OAI-SearchBot est une stratégie défendable mais imparfaite. ChatGPT Search a tendance à privilégier les contenus que GPTBot a déjà indexés. Bloquer GPTBot réduit donc indirectement votre présence dans ChatGPT Search. Mesurez avant de décider.

Configuration paywall : bloquer tout sauf pages publiques

Pour un site media avec contenu premium, il est légitime de bloquer les crawlers IA sur les contenus payants tout en les laissant indexer les pages publiques.

User-agent: GPTBot
Disallow: /premium/
Disallow: /abonnes/
Allow: /

User-agent: ClaudeBot
Disallow: /premium/
Disallow: /abonnes/
Allow: /

User-agent: PerplexityBot
Disallow: /premium/
Disallow: /abonnes/
Allow: /

Comment vérifier que la configuration fonctionne ?

Trois méthodes de vérification :

  1. Test direct du fichier : curl https://votre-domaine.com/robots.txt doit retourner exactement le contenu attendu.
  2. Test au niveau WAF/CDN : vérifier dans Cloudflare ou Vercel que les user-agents ne sont pas bloqués par des règles WAF.
  3. Test de présence réelle : interroger ChatGPT et Perplexity sur votre marque ou contenu cible 14 jours après modification, et compter les citations.

Erreurs fréquentes à éviter

Erreur 1 : oublier les variantes legacy

Anthropic utilise ClaudeBot aujourd'hui mais l'ancien anthropic-ai existe encore. OpenAI a trois user-agents distincts. Ne couvrez qu'un seul, c'est risquer d'en bloquer un autre.

Erreur 2 : Disallow * sans Allow spécifique

Une règle User-agent: * avec Disallow: / bloque tout le monde, y compris les bots IA. Si vous voulez bloquer la majorité mais autoriser les bons IA, mettez les règles spécifiques AVANT la règle catchall.

Erreur 3 : oublier la directive Sitemap

La directive Sitemap: à la fin du robots.txt est lue par les crawlers IA et accélère leur découverte de contenu. C'est gratuit, faites-le.

Erreur 4 : bloquer au niveau infrastructure

Cloudflare propose une option "Block AI Bots" en un clic. Beaucoup de sites l'ont activée sans s'en rendre compte. Vérifiez dans votre dashboard Cloudflare que cette option est désactivée si vous voulez être cité par les LLMs.

L'erreur la plus coûteuse de 2026 : avoir un robots.txt parfait mais un WAF Cloudflare qui bloque les user-agents IA au niveau réseau. Le crawler ne voit jamais votre robots.txt, il reçoit un 403 directement. Résultat : invisible total dans tous les LLMs, sans qu'aucun outil d'audit côté site ne le détecte.

Cas concret : -100 % de citations puis +400 % après correction

Un site media français a activé "Block AI Bots" sur Cloudflare en janvier 2026 par défaut sans s'en rendre compte. Résultat : 0 citation Perplexity et ChatGPT pendant 6 semaines, alors qu'il était habituellement cité 30 à 40 fois par mois. Après désactivation et correction du robots.txt, les citations sont remontées à 47 par semaine en moyenne, soit +400 % par rapport au point bas. Leçon : vérifiez systématiquement la couche infrastructure en plus du fichier robots.txt.

Faut-il bloquer les bots IA pour proteger ses droits d'auteur ?

Question légitime mais souvent mal posée. Bloquer GPTBot ne supprime pas votre contenu de GPT-5 (il a déjà été entraîné sur Common Crawl). Cela empêche seulement les futures itérations d'être entraînées sur vos nouvelles pages. La vraie protection juridique est ailleurs : conditions d'utilisation explicites, mention "all rights reserved", action légale en cas d'usage non autorisé. Le robots.txt est un signal, pas un bouclier juridique.

Configuration robots.txt par type de site : exemples complets

Voici trois configurations complètes et commentées, adaptées aux situations les plus fréquentes rencontrées lors des audits.

Configuration maximale : tout autoriser (site éditorial ou e-commerce)

Pour un site qui veut maximiser sa visibilité dans tous les moteurs IA, la configuration la plus simple est la plus efficace. Inclut un commentaire explicatif pour les futurs développeurs.

# Configuration AEO optimale - 2026
# Autoriser tous les moteurs de recherche et crawlers IA

User-agent: *
Allow: /

# OpenAI ChatGPT Search
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

# Anthropic Claude
User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

# Perplexity
User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

# Google AI
User-agent: Google-Extended
Allow: /

# Apple Intelligence
User-agent: Applebot-Extended
Allow: /

# Meta (Llama, Meta AI)
User-agent: Meta-ExternalAgent
Allow: /

Sitemap: https://votre-domaine.com/sitemap.xml

Configuration pour un site media avec paywall partiel

Autoriser l'indexation des articles gratuits, bloquer les contenus premium sur tous les bots IA, tout en maintenant la directive Sitemap pour la découverte.

# Articles gratuits accessibles à tous les crawlers IA
User-agent: GPTBot
Disallow: /abonnes/
Disallow: /premium/
Allow: /

User-agent: ClaudeBot
Disallow: /abonnes/
Disallow: /premium/
Allow: /

User-agent: PerplexityBot
Disallow: /abonnes/
Disallow: /premium/
Allow: /

Sitemap: https://votre-domaine.com/sitemap.xml

Impact mesuré des blocages et autorisations sur la citabilité IA

Les données issues des audits everlange.com permettent de quantifier précisément l'effet du robots.txt sur la visibilité dans les moteurs de réponse IA.

Cas pratique : diagnostic et correction d'une invisibilite totale en 48 heures

Un éditeur de contenus professionnels (B2B, 15 000 visiteurs/mois, 600 articles) signale en février 2026 une chute soudaine des citations IA : de 45 citations/semaine à zéro en l'espace de 10 jours. Le SEO Google est inchangé, le trafic organique est stable. Cause suspectée : modification du robots.txt.

Diagnostic en 2 heures :

Correction en 30 minutes :

Résultats : première citation ChatGPT réapparue 9 jours après la correction. Retour au niveau habituel (40+ citations/semaine) en 3 semaines. Leçon : toujours tester avec le user-agent du crawler, pas seulement lire le robots.txt.

Checklist robots.txt pour une visibilité IA maximale

Cette checklist couvre les vérifications à effectuer sur le robots.txt et l'infrastructure pour garantir qu'aucun crawler IA n'est bloqué.

Questions avancées sur le robots.txt et les crawlers IA

Les crawlers IA respectent-ils vraiment le robots.txt ?

Les grands acteurs (OpenAI, Anthropic, Google, Perplexity) déclarent respecter le standard RFC 9309. Des tests indépendants de l'EFF et de NewsGuard en 2025 ont confirmé que GPTBot, ClaudeBot et PerplexityBot respectent bien les directives Disallow. Des acteurs moins établis (certains bots chinois) sont moins fiables. Si vous voulez une garantie absolue, la protection au niveau WAF reste la seule option.

Bloquer GPTBot empêche-t-il vraiment ChatGPT de citer mon site ?

Partiellement. GPT-5 a été entraîné sur des données antérieures à votre blocage — il connaît peut-être déjà votre site. Bloquer GPTBot empêche les futures itérations d'être entraînées sur vos nouvelles pages. Pour ChatGPT Search en temps réel, c'est OAI-SearchBot qui compte davantage. Bloquer GPTBot mais autoriser OAI-SearchBot est une stratégie cohérente pour les sites qui veulent du search sans entraînement.

Faut-il un robots.txt différent par sous-domaine ?

Oui. Chaque sous-domaine a son propre robots.txt indépendant. Un robots.txt parfait sur votre domaine principal ne couvre pas blog.votre-domaine.com ni app.votre-domaine.com. Vérifiez systématiquement robots.txt sur chaque sous-domaine que vous voulez faire indexer par les LLMs.

Quel est l'impact d'un robots.txt bloquant sur le score AEO ?

Massif. Dans le moteur de scoring everlange.com, la catégorie "robots/crawlabilité IA" représente 8 % du score global. Un blocage complet de GPTBot entraîne une pénalité de -15 points sur le score On-Site. Un blocage ClaudeBot entraîne -8 points. Un blocage simultané de tous les bots IA peut faire passer un site de 60/100 à 25/100 sans aucune autre modification. C'est le critère avec le plus grand impact marginal par correction.

Conclusion : audit robots.txt + audit infra = visibilité IA

Le robots.txt est la première brique de votre stratégie AEO. Mal configuré, il rend tout le reste inutile. Pour la majorité des sites, la bonne stratégie est d'autoriser tous les bots IA majeurs explicitement, de vérifier qu'aucune règle infrastructure ne bloque, et de tester après chaque modification. C'est l'optimisation la plus rapide et la plus rentable de tout l'arsenal AEO. Vérifiez votre robots.txt aujourd'hui, vous trouverez peut-être la raison pour laquelle vous n'êtes pas cité.