Rastreadores de IA
27 rastreadores de IA, uno por uno.
Estos son los user-agents que buscan nuestra auditoría y nuestra herramienta gratuita. Cada uno es un motor de respuesta que puede citarle y enlazarle, o un rastreador solo de entrenamiento que recoge texto para modelos y no devuelve nada. Esa diferencia es la que importa al decidir qué bloquear.
Motores de respuesta: 16 rastreadores que pueden citarle
Bloquear cualquiera de estos le borra de una superficie donde un modelo podría nombrarle como fuente.
| User-agent | Operador | Qué hace |
|---|---|---|
oai-searchbot | OpenAI | Powers ChatGPT's search index |
chatgpt-user | OpenAI | Fetches a page when a user asks ChatGPT about it |
claude-user | Anthropic | Fetches a page when a user asks Claude about it |
claude-searchbot | Anthropic | Powers Claude's search results |
perplexitybot | Perplexity | Builds the index Perplexity answers from |
perplexity-user | Perplexity | Fetches a page a user asked about |
google-cloudvertexbot | Vertex AI grounding | |
bingbot | Microsoft | Copilot answers are built on the Bing index |
msnbot-media | Microsoft | Media crawling for Bing/Copilot |
meta-externalagent | Meta | Crawls for Meta AI answers |
meta-externalfetcher | Meta | Fetches a page on user request |
amazonbot | Amazon | Feeds Alexa and Rufus answers |
youbot | You.com | Indexes pages You.com can cite |
cohere-ai | Cohere | Retrieval for Cohere-powered assistants |
diffbot | Diffbot | Knowledge-graph extraction used by several assistants |
timpibot | Timpi | Independent index used by AI search products |
Las descripciones se mantienen en inglés, el idioma en que las publican sus operadores.
Solo entrenamiento: 11 rastreadores que no devuelven nada
Estos recogen contenido para entrenar modelos. Bloquearlos es una decisión de licencia: no reduce su visibilidad.
| User-agent | Operador | Qué hace |
|---|---|---|
gptbot | OpenAI | Collects content that may be used to train OpenAI models; ChatGPT search uses OAI-SearchBot instead |
claudebot | Anthropic | Collects content that may be used to train Anthropic models; Claude search uses Claude-SearchBot |
google-extended | Not a crawler: a robots.txt token for Gemini training and grounding; Google says it does not affect Google Search | |
applebot-extended | Apple | Not a crawler: a robots.txt token for training Apple models; Apple says it does not affect Apple search |
claude-web | Anthropic | Legacy Anthropic agent no longer documented; current user fetches use Claude-User |
ccbot | Common Crawl | Public dataset many models train on |
bytespider | ByteDance | Training data collection |
omgili | Webz.io | Data resale and training corpora |
anthropic-ai | Anthropic | Legacy training-data agent (no live citation) |
facebookbot | Meta | Training data collection |
petalbot | Huawei | Petal search and training corpora |
Las descripciones se mantienen en inglés, el idioma en que las publican sus operadores.
Controlar un solo rastreador
robots.txt funciona por user-agent. Este grupo bloquea un rastreador y deja todo lo demás como está:
User-agent: CCBot
Disallow: /Bloquear un rastreador de motor de respuesta le saca de las respuestas de ese motor. Bloquear uno solo de entrenamiento no cambia si se le cita.
Compruebe su propio robots.txt
La herramienta gratuita lee su robots.txt y su llms.txt y le dice cuáles de estos 27 rastreadores permite.
Esta página se genera con el mismo catálogo que usa el producto, así que no puede desviarse de lo que comprueba la auditoría.