Faut-il autoriser les robots des IA sur son site ?
Publié le
Oui pour les robots qui servent la recherche, si vous voulez être cité par les IA ; c’est un choix libre pour ceux qui collectent des données d’entraînement. OpenAI, Anthropic et Google séparent ces deux usages : chez OpenAI, un site qui bloque OAI-SearchBot n’est pas montré dans les réponses de recherche de ChatGPT, alors que bloquer GPTBot ne concerne que l’entraînement. Nos mesures vont dans le même sens : aucun des sites cités par ChatGPT n’interdisait OAI-SearchBot, mais 3 % d’entre eux interdisaient GPTBot.
Pour quel type de question ? Tout dépend du robot. Un robot de recherche décide si votre site peut apparaître dans les réponses. Un robot d’entraînement décide si vos contenus peuvent servir à entraîner les futurs modèles. Les deux réglages sont indépendants.
Deux familles de robots, deux décisions différentes
OpenAI documente trois robots. OAI-SearchBot sert à faire apparaître des sites dans les résultats de recherche de ChatGPT ; un site qui l’exclut n’est pas montré dans ses réponses de recherche, même s’il peut encore apparaître comme lien de navigation. GPTBot collecte des contenus qui peuvent servir à entraîner ses modèles. ChatGPT-User intervient pour certaines actions des utilisateurs. OpenAI précise que chaque réglage est indépendant : un site peut autoriser OAI-SearchBot pour apparaître dans la recherche tout en interdisant GPTBot.
Anthropic fait la même distinction. ClaudeBot collecte des contenus pour l’entraînement ; le bloquer exclut les futurs contenus du site des données d’entraînement. Claude-SearchBot améliore la qualité des résultats de recherche, et Claude-User accède aux sites quand un utilisateur pose une question ; les bloquer peut réduire la visibilité du site dans les réponses. Chez Google, Google-Extended décide si les contenus peuvent servir à entraîner les futurs modèles Gemini, et Google précise qu’il n’a aucun effet sur l’inclusion d’un site dans la recherche Google ni sur son classement.
Ce que nous avons mesuré dans les robots.txt
Nous avons lu le fichier robots.txt de chaque site ramené par la recherche de ChatGPT, Claude et Gemini sur une dizaine de secteurs d’activité interrogés en français, le jour de la collecte, le 10 septembre 2026. Première observation : la grande majorité des sites ne parlent pas des robots des IA. OAI-SearchBot n’est mentionné que par 5 à 6 % des sites, et GPTBot par 11 à 16 %, selon qu’ils ont été cités ou non.
Deuxième observation : moins de 1 % des sites ramenés par la recherche de ChatGPT interdisaient OAI-SearchBot, et aucun des sites qu’il a cités, ce qui concorde avec la documentation d’OpenAI. En revanche, interdire l’entraînement n’a pas empêché la citation : 3 % des sites cités par ChatGPT interdisaient GPTBot, contre 8 % des sites qu’il a ramenés sans les citer. Chez Claude, 5 % des sites cités interdisaient ClaudeBot, contre 4 % des sites non cités ; chez Gemini, 2 % des sites cités interdisaient Google-Extended.
Ce que ces chiffres veulent dire
Bloquer un robot d’entraînement ne ferme pas la porte des réponses. Des sites qui refusent que leurs contenus entraînent GPT, Claude ou Gemini sont quand même trouvés et cités par ces IA quand elles cherchent sur le web, parce que ce sont d’autres robots, ou le moteur de recherche lui-même, qui lisent les pages à ce moment-là.
À l’inverse, bloquer un robot de recherche retire le site des réponses de l’IA concernée. Chez ChatGPT, le constat est net : parmi les sites qu’il a cités, nous n’en avons trouvé aucun qui interdisait OAI-SearchBot. Autoriser ce robot ne suffit pas à être cité ; selon OpenAI, l’interdire suffit à ne pas être montré dans ses réponses de recherche.
Ce que cela change pour une entreprise
Vérifiez votre fichier robots.txt. Si vous voulez être cité, laissez passer les robots de recherche : OAI-SearchBot et ChatGPT-User pour ChatGPT, Claude-SearchBot et Claude-User pour Claude, et Googlebot pour Google et ses réponses IA. Vérifiez aussi qu’un pare-feu ou un service de protection contre les robots ne les bloque pas avant même la lecture du fichier.
Pour les robots d’entraînement, GPTBot, ClaudeBot et Google-Extended, la décision relève de votre politique sur l’usage de vos contenus, pas de votre visibilité dans les réponses : nos mesures ne montrent pas que les bloquer empêche d’être cité. C’est un choix à faire en connaissance de cause, pas un réglage technique à laisser au hasard.
Ce que nous ne savons pas
Nous avons lu les robots.txt le jour de la collecte, sans vérifier si les robots respectent réellement ces fichiers ni si un pare-feu les bloquait. Claude-SearchBot et Claude-User ne faisaient pas partie des robots lus. Un fichier absent a été compté comme ne mentionnant aucun robot.
Sources
- OpenAI — robots d’indexation d’OpenAI, .
- Anthropic — robots d’Anthropic et blocage par les sites, .
- Google Search Central — robots d’exploration courants de Google, .
- Mesures FaireDuBruit, du 4 au 16 septembre 2026 — voir « Comment nous avons mesuré ».
Questions voisines
- Le fichier llms.txt aide-t-il à être cité par les IA ?
- Mon site internet suffit-il pour être visible dans les IA ?
- Pourquoi ChatGPT ne cite-t-il pas mon entreprise ?
- Être bien classé sur Google aide-t-il à être cité par ChatGPT ?
Toutes les questions sur la visibilité dans les IA · Notre offre · Tester mon site