Robots d'IA
27 robots d'IA, un par un.
Voici les user-agents que recherchent notre audit et notre outil gratuit. Chacun est soit un moteur de réponse qui peut vous citer et vous lier, soit un robot d'entraînement seul qui collecte du texte pour des modèles et ne renvoie rien. C'est cette différence qui compte quand vous décidez quoi bloquer.
Moteurs de réponse : 16 robots qui peuvent vous citer
En bloquer un vous retire d'une surface où un modèle pourrait vous nommer comme source.
| User-agent | Exploitant | Ce qu'il fait |
|---|---|---|
oai-searchbot | OpenAI | Powers ChatGPT's search index |
chatgpt-user | OpenAI | Fetches a page when a user asks ChatGPT about it |
claude-user | Anthropic | Fetches a page when a user asks Claude about it |
claude-searchbot | Anthropic | Powers Claude's search results |
perplexitybot | Perplexity | Builds the index Perplexity answers from |
perplexity-user | Perplexity | Fetches a page a user asked about |
google-cloudvertexbot | Vertex AI grounding | |
bingbot | Microsoft | Copilot answers are built on the Bing index |
msnbot-media | Microsoft | Media crawling for Bing/Copilot |
meta-externalagent | Meta | Crawls for Meta AI answers |
meta-externalfetcher | Meta | Fetches a page on user request |
amazonbot | Amazon | Feeds Alexa and Rufus answers |
youbot | You.com | Indexes pages You.com can cite |
cohere-ai | Cohere | Retrieval for Cohere-powered assistants |
diffbot | Diffbot | Knowledge-graph extraction used by several assistants |
timpibot | Timpi | Independent index used by AI search products |
Les descriptions restent en anglais, la langue dans laquelle leurs exploitants les publient.
Entraînement seul : 11 robots qui ne rendent rien
Ceux-ci collectent du contenu pour entraîner des modèles. Les bloquer est une décision de licence : cela ne réduit pas votre visibilité.
| User-agent | Exploitant | Ce qu'il fait |
|---|---|---|
gptbot | OpenAI | Collects content that may be used to train OpenAI models; ChatGPT search uses OAI-SearchBot instead |
claudebot | Anthropic | Collects content that may be used to train Anthropic models; Claude search uses Claude-SearchBot |
google-extended | Not a crawler: a robots.txt token for Gemini training and grounding; Google says it does not affect Google Search | |
applebot-extended | Apple | Not a crawler: a robots.txt token for training Apple models; Apple says it does not affect Apple search |
claude-web | Anthropic | Legacy Anthropic agent no longer documented; current user fetches use Claude-User |
ccbot | Common Crawl | Public dataset many models train on |
bytespider | ByteDance | Training data collection |
omgili | Webz.io | Data resale and training corpora |
anthropic-ai | Anthropic | Legacy training-data agent (no live citation) |
facebookbot | Meta | Training data collection |
petalbot | Huawei | Petal search and training corpora |
Les descriptions restent en anglais, la langue dans laquelle leurs exploitants les publient.
Contrôler un seul robot
robots.txt fonctionne par user-agent. Ce groupe bloque un robot et laisse tout le reste tel quel :
User-agent: CCBot
Disallow: /Bloquer le robot d'un moteur de réponse vous retire de ses réponses. Bloquer un robot d'entraînement seul ne change rien au fait d'être cité.
Vérifiez votre propre robots.txt
L'outil gratuit lit votre robots.txt et votre llms.txt et vous indique lesquels de ces 27 robots vous autorisez.
Cette page est générée à partir du même catalogue que le produit, elle ne peut donc pas s'écarter de ce que vérifie l'audit.