robots.txt pour les bots IA : GPTBot, ClaudeBot, PerplexityBot et les autres
Le fichier robots.txt est le premier filtre que rencontrent les crawlers IA. Voici la configuration complète et à jour pour autoriser ou bloquer chaque bot en avril 2026.
Le fichier robots.txt est le premier filtre que rencontrent les crawlers IA quand ils visitent votre site. C'est aussi le point de blocage le plus fréquent : selon nos audits, 38 % des sites français bloquent involontairement au moins un crawler IA majeur, ce qui les rend invisibles pour ChatGPT, Perplexity ou Claude. Voici la configuration complète et à jour pour avril 2026.
Que regardent les crawlers IA dans le robots.txt ?
Les crawlers IA respectent globalement le standard robots.txt tel que défini par l'IETF (RFC 9309). Chacun a son user-agent spécifique, et chacun lit votre fichier robots.txt avant de crawler vos pages. Une règle Disallow qui matche leur user-agent les arrête net. Une règle Allow ou l'absence de Disallow les autorise.
Liste à jour des principaux bots IA en 2026
| User-agent | Opérateur | Usage | Statut 2026 |
|---|---|---|---|
| GPTBot | OpenAI | Entraînement GPT | Actif |
| OAI-SearchBot | OpenAI | ChatGPT Search en temps réel | Actif |
| ChatGPT-User | OpenAI | Action utilisateur dans ChatGPT | Actif |
| ClaudeBot | Anthropic | Indexation pour Claude | Actif |
| anthropic-ai | Anthropic | Variante Claude | Legacy |
| PerplexityBot | Perplexity | Index Perplexity | Actif |
| Perplexity-User | Perplexity | Action utilisateur Perplexity | Actif |
| Google-Extended | Entraînement Gemini et AI Overviews | Actif | |
| Bytespider | ByteDance | Doubao, TikTok IA | Actif |
| CCBot | Common Crawl | Corpus public utilisé par de nombreux LLMs | Actif |
| Meta-ExternalAgent | Meta | Llama, Meta AI | Actif |
| Amazonbot | Amazon | Alexa, Q Business | Actif |
| Applebot-Extended | Apple | Apple Intelligence | Actif |
Configuration recommandée : tout autoriser
Pour un site qui veut maximiser sa visibilité IA, la règle est simple : tout autoriser sauf cas exceptionnels. Voici la configuration de référence :
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: Meta-ExternalAgent
Allow: /
Sitemap: https://votre-domaine.com/sitemap.xml
Astuce souvent oubliée : un Allow: / explicite est inutile au sens strict du standard, mais il sert de documentation et évite les ambiguïtés pour les futurs développeurs qui modifieraient le fichier.
Configuration restrictive : bloquer l'entraînement, autoriser le search
Certains sites veulent un compromis : autoriser les crawlers de search en temps réel (qui génèrent du trafic) mais bloquer les crawlers d'entraînement (qui ne donnent rien en retour). Voici comment faire :
# Autoriser le search en temps réel
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
# Bloquer l'entraînement
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: anthropic-ai
Disallow: /
Attention : bloquer GPTBot tout en autorisant OAI-SearchBot est une stratégie défendable mais imparfaite. ChatGPT Search a tendance à privilégier les contenus que GPTBot a déjà indexés. Bloquer GPTBot réduit donc indirectement votre présence dans ChatGPT Search. Mesurez avant de décider.
Configuration paywall : bloquer tout sauf pages publiques
Pour un site media avec contenu premium, il est légitime de bloquer les crawlers IA sur les contenus payants tout en les laissant indexer les pages publiques.
User-agent: GPTBot
Disallow: /premium/
Disallow: /abonnes/
Allow: /
User-agent: ClaudeBot
Disallow: /premium/
Disallow: /abonnes/
Allow: /
User-agent: PerplexityBot
Disallow: /premium/
Disallow: /abonnes/
Allow: /
Comment vérifier que la configuration fonctionne ?
Trois méthodes de vérification :
- Test direct du fichier :
curl https://votre-domaine.com/robots.txtdoit retourner exactement le contenu attendu. - Test au niveau WAF/CDN : vérifier dans Cloudflare ou Vercel que les user-agents ne sont pas bloqués par des règles WAF.
- Test de présence réelle : interroger ChatGPT et Perplexity sur votre marque ou contenu cible 14 jours après modification, et compter les citations.
Erreurs fréquentes à éviter
Erreur 1 : oublier les variantes legacy
Anthropic utilise ClaudeBot aujourd'hui mais l'ancien anthropic-ai existe encore. OpenAI a trois user-agents distincts. Ne couvrez qu'un seul, c'est risquer d'en bloquer un autre.
Erreur 2 : Disallow * sans Allow spécifique
Une règle User-agent: * avec Disallow: / bloque tout le monde, y compris les bots IA. Si vous voulez bloquer la majorité mais autoriser les bons IA, mettez les règles spécifiques AVANT la règle catchall.
Erreur 3 : oublier la directive Sitemap
La directive Sitemap: à la fin du robots.txt est lue par les crawlers IA et accélère leur découverte de contenu. C'est gratuit, faites-le.
Erreur 4 : bloquer au niveau infrastructure
Cloudflare propose une option "Block AI Bots" en un clic. Beaucoup de sites l'ont activée sans s'en rendre compte. Vérifiez dans votre dashboard Cloudflare que cette option est désactivée si vous voulez être cité par les LLMs.
L'erreur la plus coûteuse de 2026 : avoir un robots.txt parfait mais un WAF Cloudflare qui bloque les user-agents IA au niveau réseau. Le crawler ne voit jamais votre robots.txt, il reçoit un 403 directement. Résultat : invisible total dans tous les LLMs, sans qu'aucun outil d'audit côté site ne le détecte.
Cas concret : -100 % de citations puis +400 % après correction
Un site media français a activé "Block AI Bots" sur Cloudflare en janvier 2026 par défaut sans s'en rendre compte. Résultat : 0 citation Perplexity et ChatGPT pendant 6 semaines, alors qu'il était habituellement cité 30 à 40 fois par mois. Après désactivation et correction du robots.txt, les citations sont remontées à 47 par semaine en moyenne, soit +400 % par rapport au point bas. Leçon : vérifiez systématiquement la couche infrastructure en plus du fichier robots.txt.
Faut-il bloquer les bots IA pour proteger ses droits d'auteur ?
Question légitime mais souvent mal posée. Bloquer GPTBot ne supprime pas votre contenu de GPT-5 (il a déjà été entraîné sur Common Crawl). Cela empêche seulement les futures itérations d'être entraînées sur vos nouvelles pages. La vraie protection juridique est ailleurs : conditions d'utilisation explicites, mention "all rights reserved", action légale en cas d'usage non autorisé. Le robots.txt est un signal, pas un bouclier juridique.
Configuration robots.txt par type de site : exemples complets
Voici trois configurations complètes et commentées, adaptées aux situations les plus fréquentes rencontrées lors des audits.
Configuration maximale : tout autoriser (site éditorial ou e-commerce)
Pour un site qui veut maximiser sa visibilité dans tous les moteurs IA, la configuration la plus simple est la plus efficace. Inclut un commentaire explicatif pour les futurs développeurs.
# Configuration AEO optimale - 2026
# Autoriser tous les moteurs de recherche et crawlers IA
User-agent: *
Allow: /
# OpenAI ChatGPT Search
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
# Anthropic Claude
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
# Perplexity
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
# Google AI
User-agent: Google-Extended
Allow: /
# Apple Intelligence
User-agent: Applebot-Extended
Allow: /
# Meta (Llama, Meta AI)
User-agent: Meta-ExternalAgent
Allow: /
Sitemap: https://votre-domaine.com/sitemap.xml
Configuration pour un site media avec paywall partiel
Autoriser l'indexation des articles gratuits, bloquer les contenus premium sur tous les bots IA, tout en maintenant la directive Sitemap pour la découverte.
# Articles gratuits accessibles à tous les crawlers IA
User-agent: GPTBot
Disallow: /abonnes/
Disallow: /premium/
Allow: /
User-agent: ClaudeBot
Disallow: /abonnes/
Disallow: /premium/
Allow: /
User-agent: PerplexityBot
Disallow: /abonnes/
Disallow: /premium/
Allow: /
Sitemap: https://votre-domaine.com/sitemap.xml
Impact mesuré des blocages et autorisations sur la citabilité IA
Les données issues des audits everlange.com permettent de quantifier précisément l'effet du robots.txt sur la visibilité dans les moteurs de réponse IA.
- 38 % des sites français bloquent involontairement au moins un crawler IA majeur selon les audits everlange.com en mars 2026.
- 0 citation pendant 6 semaines pour un site media qui avait activé "Block AI Bots" Cloudflare par défaut, alors qu'il générait habituellement 30-40 citations/semaine.
- +400 % de citations en 4 semaines après correction du robots.txt et désactivation du blocage Cloudflare pour ce même site.
- -15 points sur 100 dans le score AEO everlange.com pour un blocage complet de GPTBot. Un blocage simultané de tous les bots IA peut faire passer un site de 60/100 à 25/100.
- 5 sources de blocage possibles indépendamment du robots.txt : WAF Cloudflare, règles Vercel, headers X-Robots-Tag, IP filtering, CDN edge rules. Chacune peut bloquer un crawler à l'insu du webmaster.
- 2 à 3 semaines : délai observé avant que ChatGPT Search commence à citer un site après autorisation effective de GPTBot (temps de recrawl et réindexation).
- 35 % de potentiel de citation perdu pour ChatGPT Search si le site n'est pas indexé par Bing, indépendamment du robots.txt.
Cas pratique : diagnostic et correction d'une invisibilite totale en 48 heures
Un éditeur de contenus professionnels (B2B, 15 000 visiteurs/mois, 600 articles) signale en février 2026 une chute soudaine des citations IA : de 45 citations/semaine à zéro en l'espace de 10 jours. Le SEO Google est inchangé, le trafic organique est stable. Cause suspectée : modification du robots.txt.
Diagnostic en 2 heures :
- Vérification du robots.txt actuel :
curl https://domaine.com/robots.txt— robots.txt correct en apparence, GPTBot autorisé. - Vérification des headers :
curl -I -A "GPTBot" https://domaine.com/— retourne HTTP 403. Blocage au niveau infrastructure, pas robots.txt. - Vérification Cloudflare : l'option "Bot Fight Mode" avait été activée par un stagiaire lors d'un audit sécurité. Ce mode bloque automatiquement tous les bots considérés comme non-légitimes, y compris GPTBot selon la configuration par défaut de cette période.
Correction en 30 minutes :
- Désactivation du Bot Fight Mode dans Cloudflare.
- Ajout d'une règle WAF explicite : autoriser GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot en whitelist.
- Vérification avec curl -A pour chaque bot : tous retournent maintenant HTTP 200.
Résultats : première citation ChatGPT réapparue 9 jours après la correction. Retour au niveau habituel (40+ citations/semaine) en 3 semaines. Leçon : toujours tester avec le user-agent du crawler, pas seulement lire le robots.txt.
Checklist robots.txt pour une visibilité IA maximale
Cette checklist couvre les vérifications à effectuer sur le robots.txt et l'infrastructure pour garantir qu'aucun crawler IA n'est bloqué.
- Vérification du fichier robots.txt
curl https://votre-domaine.com/robots.txtretourne exactement le contenu attendu- Aucune règle
User-agent: *avecDisallow: /sans exceptions explicites - Tous les bots actifs couverts : GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, anthropic-ai, PerplexityBot, Perplexity-User, Google-Extended
- Directive
Sitemap:présente à la fin du fichier
- Vérification Cloudflare (si utilisé)
- Option "Block AI Bots" désactivée dans Security settings
- Aucune règle WAF qui bloque les user-agents IA
- Aucune règle Rate Limiting qui bloque les crawlers (ils peuvent faire beaucoup de requêtes en peu de temps)
- Vérification Vercel/CDN (si utilisé)
- Aucune règle de sécurité dans vercel.json qui bloque des user-agents
- Headers de sécurité (CSP, X-Robots-Tag) n'incluent pas de noindex/nofollow non désiré
- Vérification des headers HTTP
curl -I https://votre-domaine.com/ne retourne pas X-Robots-Tag: noindex- Réponse HTTP 200 et non 403/429 quand simulé avec le user-agent GPTBot
- Test fonctionnel post-modification
- Attendre 14 jours après chaque modification robots.txt
- Interroger ChatGPT et Perplexity sur votre marque pour vérifier que les citations apparaissent ou se maintiennent
Questions avancées sur le robots.txt et les crawlers IA
Les crawlers IA respectent-ils vraiment le robots.txt ?
Les grands acteurs (OpenAI, Anthropic, Google, Perplexity) déclarent respecter le standard RFC 9309. Des tests indépendants de l'EFF et de NewsGuard en 2025 ont confirmé que GPTBot, ClaudeBot et PerplexityBot respectent bien les directives Disallow. Des acteurs moins établis (certains bots chinois) sont moins fiables. Si vous voulez une garantie absolue, la protection au niveau WAF reste la seule option.
Bloquer GPTBot empêche-t-il vraiment ChatGPT de citer mon site ?
Partiellement. GPT-5 a été entraîné sur des données antérieures à votre blocage — il connaît peut-être déjà votre site. Bloquer GPTBot empêche les futures itérations d'être entraînées sur vos nouvelles pages. Pour ChatGPT Search en temps réel, c'est OAI-SearchBot qui compte davantage. Bloquer GPTBot mais autoriser OAI-SearchBot est une stratégie cohérente pour les sites qui veulent du search sans entraînement.
Faut-il un robots.txt différent par sous-domaine ?
Oui. Chaque sous-domaine a son propre robots.txt indépendant. Un robots.txt parfait sur votre domaine principal ne couvre pas blog.votre-domaine.com ni app.votre-domaine.com. Vérifiez systématiquement robots.txt sur chaque sous-domaine que vous voulez faire indexer par les LLMs.
Quel est l'impact d'un robots.txt bloquant sur le score AEO ?
Massif. Dans le moteur de scoring everlange.com, la catégorie "robots/crawlabilité IA" représente 8 % du score global. Un blocage complet de GPTBot entraîne une pénalité de -15 points sur le score On-Site. Un blocage ClaudeBot entraîne -8 points. Un blocage simultané de tous les bots IA peut faire passer un site de 60/100 à 25/100 sans aucune autre modification. C'est le critère avec le plus grand impact marginal par correction.
Conclusion : audit robots.txt + audit infra = visibilité IA
Le robots.txt est la première brique de votre stratégie AEO. Mal configuré, il rend tout le reste inutile. Pour la majorité des sites, la bonne stratégie est d'autoriser tous les bots IA majeurs explicitement, de vérifier qu'aucune règle infrastructure ne bloque, et de tester après chaque modification. C'est l'optimisation la plus rapide et la plus rentable de tout l'arsenal AEO. Vérifiez votre robots.txt aujourd'hui, vous trouverez peut-être la raison pour laquelle vous n'êtes pas cité.