Respuesta corta: robots.txt es el que decide si los sistemas de IA pueden leer tu web, porque controla qué rastreadores pueden descargar tus páginas. llms.txt solo describe qué páginas merece la pena leer. Si robots.txt bloquea al rastreador de un motor de respuesta, ningún llms.txt hará que ese motor te cite. Empieza por robots.txt; añade llms.txt como guía.
¿Qué hace cada archivo?
| robots.txt | llms.txt | |
|---|---|---|
| Finalidad | Permitir o bloquear rastreadores | Señalar a los modelos las páginas clave |
| Estado | Estándar (RFC 9309, 2022) | Propuesta de la comunidad (2024) |
| Quién lo lee | Todo rastreador que respeta las normas | Algunas herramientas y agentes de IA |
| Lo usa la Búsqueda de Google | Sí | Google dice que no |
| Puede bloquear el acceso | Sí | No |
| Formato | Reglas User-agent y Disallow |
Markdown con enlaces |
Los dos archivos no compiten. robots.txt es la puerta; llms.txt es un plano que dejas sobre la mesa cuando la gente ya ha entrado.
¿Por qué robots.txt importa más para la visibilidad en IA?
Porque el acceso va primero. Cada motor de respuesta con IA usa su propio rastreador, y cada rastreador consulta robots.txt antes de descargar nada:
- La búsqueda de ChatGPT usa OAI-SearchBot. OpenAI indica que los sitios que lo excluyen no aparecerán en las respuestas de la búsqueda de ChatGPT.
- Perplexity usa PerplexityBot para sus resultados de búsqueda.
- La búsqueda de Claude usa Claude-SearchBot.
- Google AI Overviews forma parte de la Búsqueda y depende de Googlebot.
Si alguno de ellos está bloqueado, ese motor no puede descargar tus páginas para citarlas. Un llms.txt impecable no cambia nada, porque el rastreador nunca pasa de la puerta.
¿Qué bots deberías bloquear y cuáles permitir?
Esta es la decisión que importa, y la mayoría de los robots.txt la toman mal porque tratan igual a todos los bots de IA. Hay dos tipos:
- Rastreadores de motores de respuesta: descargan páginas para mostrarlas y enlazarlas en las respuestas. Bloquearlos te saca de los resultados de ese motor.
- Rastreadores solo de entrenamiento: recopilan texto para entrenar modelos. Bloquearlos es una decisión de licencias. No te saca de las respuestas.
Los nombres se confunden con facilidad. GPTBot es el rastreador de entrenamiento de OpenAI; OAI-SearchBot es el que alimenta la búsqueda de ChatGPT. ClaudeBot es el rastreador de entrenamiento de Anthropic; Claude-SearchBot alimenta la búsqueda. Google-Extended y Applebot-Extended ni siquiera son rastreadores, sino tokens de robots.txt que controlan el uso para entrenamiento, y tanto Google como Apple dicen que no afectan a la búsqueda.
Una política habitual y razonable para una empresa que quiere que la citen pero no que usen su contenido para entrenar es esta:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: *
Allow: /
Así los rastreadores de motores de respuesta, incluidos OAI-SearchBot, Claude-SearchBot y PerplexityBot, siguen teniendo acceso a través del grupo comodín, mientras te excluyes de los usos de entrenamiento indicados. Excluirte o no del entrenamiento es decisión tuya; lo importante es tomarla a propósito. Nuestra lista de rastreadores de IA muestra cada agente que seguimos y a qué grupo pertenece.
¿Qué errores vemos con más frecuencia?
- Bloquear con un comodín.
User-agent: *conDisallow: /bloquea a todos los rastreadores que no tienen su propio grupo, motores de respuesta incluidos. - Copiar una "lista de bloqueo de IA" de un foro. Estas listas suelen incluir OAI-SearchBot y PerplexityBot junto a los bots de entrenamiento, y sacan el sitio de las respuestas de IA sin que nadie se dé cuenta.
- Creer que robots.txt saca páginas de los índices. Controla el rastreo. Una URL bloqueada puede seguir apareciendo si otras páginas enlazan a ella. Usa
noindexen una página rastreable para dejarla fuera. - Un llms.txt que en realidad es una página HTML. Muchos sitios devuelven su página 404 con estado 200 en
/llms.txt. Las herramientas que solo miran el código de estado creen que el archivo existe.
¿Dónde sigue ayudando llms.txt?
Una vez que el acceso es correcto, llms.txt puede facilitar el trabajo de un modelo en sitios grandes o técnicos: señala las páginas que responden a preguntas reales en lugar de dejar que el modelo adivine a partir de la navegación. Es más útil en documentación, APIs y productos SaaS. Explicamos cómo escribir uno en qué es llms.txt.
¿Cuál es la visión del SEO clásico?
robots.txt forma parte del SEO desde hace décadas, y las reglas son las mismas: no bloquees páginas que quieres indexadas, no lo uses para esconder contenido sensible y mantenlo lo bastante corto como para poder revisarlo. Lo nuevo es que ahora hay muchos más user-agents que tener en cuenta, y la diferencia entre un bot de entrenamiento y un bot de búsqueda cambia lo que te cuesta un bloqueo.
¿Cómo compruebas tu propio sitio?
Nuestro comprobador gratuito de robots.txt y llms.txt lee tu robots.txt, te dice qué rastreadores de motores de respuesta y de entrenamiento permites, y comprueba si tu llms.txt es un archivo de verdad. Solo necesita una petición y ningún registro.
Preguntas frecuentes
Si bloqueo GPTBot, ¿ChatGPT dejará de citarme?
No. GPTBot se usa para entrenar. La búsqueda de ChatGPT usa OAI-SearchBot. Bloquear GPTBot te excluye del entrenamiento, no de la búsqueda de ChatGPT.
¿Necesito llms.txt si mi robots.txt es correcto?
No estrictamente. Un robots.txt correcto es el requisito; llms.txt es una guía opcional que ayuda a algunas herramientas de IA en sitios grandes o técnicos.
¿Google lee llms.txt?
Google ha dicho que la Búsqueda de Google no usa llms.txt. robots.txt, en cambio, sí lo lee.
¿robots.txt puede proteger contenido privado?
No. robots.txt es público y solo pide a los rastreadores que no descarguen. Todo lo privado necesita autenticación.
