Rastreadores de IA

27 rastreadores de IA, uno por uno.

Estos son los user-agents que buscan nuestra auditoría y nuestra herramienta gratuita. Cada uno es un motor de respuesta que puede citarle y enlazarle, o un rastreador solo de entrenamiento que recoge texto para modelos y no devuelve nada. Esa diferencia es la que importa al decidir qué bloquear.

Motores de respuesta: 16 rastreadores que pueden citarle

Bloquear cualquiera de estos le borra de una superficie donde un modelo podría nombrarle como fuente.

User-agentOperadorQué hace
oai-searchbotOpenAIPowers ChatGPT's search index
chatgpt-userOpenAIFetches a page when a user asks ChatGPT about it
claude-userAnthropicFetches a page when a user asks Claude about it
claude-searchbotAnthropicPowers Claude's search results
perplexitybotPerplexityBuilds the index Perplexity answers from
perplexity-userPerplexityFetches a page a user asked about
google-cloudvertexbotGoogleVertex AI grounding
bingbotMicrosoftCopilot answers are built on the Bing index
msnbot-mediaMicrosoftMedia crawling for Bing/Copilot
meta-externalagentMetaCrawls for Meta AI answers
meta-externalfetcherMetaFetches a page on user request
amazonbotAmazonFeeds Alexa and Rufus answers
youbotYou.comIndexes pages You.com can cite
cohere-aiCohereRetrieval for Cohere-powered assistants
diffbotDiffbotKnowledge-graph extraction used by several assistants
timpibotTimpiIndependent index used by AI search products

Las descripciones se mantienen en inglés, el idioma en que las publican sus operadores.

Solo entrenamiento: 11 rastreadores que no devuelven nada

Estos recogen contenido para entrenar modelos. Bloquearlos es una decisión de licencia: no reduce su visibilidad.

User-agentOperadorQué hace
gptbotOpenAICollects content that may be used to train OpenAI models; ChatGPT search uses OAI-SearchBot instead
claudebotAnthropicCollects content that may be used to train Anthropic models; Claude search uses Claude-SearchBot
google-extendedGoogleNot a crawler: a robots.txt token for Gemini training and grounding; Google says it does not affect Google Search
applebot-extendedAppleNot a crawler: a robots.txt token for training Apple models; Apple says it does not affect Apple search
claude-webAnthropicLegacy Anthropic agent no longer documented; current user fetches use Claude-User
ccbotCommon CrawlPublic dataset many models train on
bytespiderByteDanceTraining data collection
omgiliWebz.ioData resale and training corpora
anthropic-aiAnthropicLegacy training-data agent (no live citation)
facebookbotMetaTraining data collection
petalbotHuaweiPetal search and training corpora

Las descripciones se mantienen en inglés, el idioma en que las publican sus operadores.

Controlar un solo rastreador

robots.txt funciona por user-agent. Este grupo bloquea un rastreador y deja todo lo demás como está:

User-agent: CCBot
Disallow: /

Bloquear un rastreador de motor de respuesta le saca de las respuestas de ese motor. Bloquear uno solo de entrenamiento no cambia si se le cita.

Compruebe su propio robots.txt

La herramienta gratuita lee su robots.txt y su llms.txt y le dice cuáles de estos 27 rastreadores permite.

Abrir la herramienta

Esta página se genera con el mismo catálogo que usa el producto, así que no puede desviarse de lo que comprueba la auditoría.