GEO

Qué es llms.txt y si tu web debería tener uno

llms.txt es un archivo Markdown propuesto que indica a los modelos de lenguaje qué páginas de tu sitio importan. Aquí ves qué hace, qué no hace y si merece la pena añadirlo.

Respuesta corta: llms.txt es un archivo Markdown sencillo en la raíz de tu sitio (/llms.txt) que enumera tus páginas más útiles con una descripción de una línea, para que un modelo de lenguaje pueda encontrarlas sin analizar toda tu navegación. Es una propuesta, no un estándar. Escribirlo lleva una hora, ayuda a algunas herramientas de IA y Google ha dicho que no lo usa.

¿Qué es exactamente llms.txt?

llms.txt lo propuso en septiembre de 2024 Jeremy Howard, de Answer.AI, y está documentado en llmstxt.org. La idea es sencilla: las páginas web están hechas para personas y navegadores, llenas de menús, scripts y maquetación. Un modelo de lenguaje que lee tu sitio tiene una ventana de contexto limitada, así que un mapa breve y seleccionado del tipo "esto es lo que somos y estas son las páginas que merece la pena leer" es más fácil de usar que el HTML en bruto.

El archivo es Markdown normal con una forma fija:

  • un H1 con el nombre del sitio o del proyecto,
  • una cita breve que resume qué es,
  • párrafos de contexto opcionales,
  • secciones H2 con listas de enlaces, cada uno con una nota corta.

Algunos sitios publican además llms-full.txt, un único archivo con el texto completo de sus páginas clave. Esa variante es habitual en la documentación para desarrolladores.

¿Qué no hace llms.txt?

Aquí empieza casi toda la confusión, así que conviene ser preciso.

  • No controla el acceso. llms.txt no puede permitir ni bloquear a ningún rastreador. El acceso lo decide robots.txt, que es un archivo distinto con otra función. Comparamos los dos en llms.txt vs robots.txt.
  • No es una señal de posicionamiento para Google. Portavoces de Google han dicho públicamente que la Búsqueda de Google no usa llms.txt. Tómalo como posicionamiento para herramientas de IA, no como una táctica de SEO para Google.
  • No hay garantía de que se lea. Ningún gran proveedor de IA se ha comprometido a leer llms.txt en todos los sitios. Algunas herramientas y agentes para desarrolladores sí lo leen cuando se les indica un sitio.

Así que llms.txt es una pista útil, no un interruptor.

¿A quién le sirve de verdad un archivo llms.txt?

Salen ganando sobre todo los sitios que leen desarrolladores, agentes y herramientas de documentación: productos SaaS, APIs, proyectos de código abierto y bases de conocimiento. Cuando alguien le pide a un asistente de programación con IA que "lea la documentación de X", un llms.txt limpio le ahorra adivinar cuáles de tus 400 páginas son la referencia de verdad.

Para un negocio local o un blog pequeño, el beneficio es menor. Rara vez perjudica, pero no arreglará un sitio que los motores de respuesta ya no pueden leer de entrada. Si tu contenido solo se renderiza con JavaScript, o está bloqueado en robots.txt, llms.txt no lo va a rescatar.

¿Cómo se escribe un buen llms.txt?

Que sea breve y honesto. Un archivo útil para un sitio SaaS podría ser así:

# ExampleCo

> ExampleCo is invoicing software for freelancers in the EU.

## Product
- [Features](https://example.com/features): what the product does
- [Pricing](https://example.com/pricing): plans and what each includes

## Help
- [Getting started](https://example.com/docs/start): set up in ten minutes
- [VAT rules](https://example.com/docs/vat): how EU VAT is calculated

Reglas prácticas:

  • Enlaza solo páginas que respondan a preguntas reales. Una lista de todas las URLs es un sitemap, no una guía.
  • Escribe cada nota como una frase sencilla que diga qué contiene la página.
  • Mantén el archivo sincronizado con tu sitio. Un llms.txt desactualizado que enlaza a páginas 404 es peor que no tener ninguno.
  • Sírvelo como texto plano o Markdown con estado 200. Un error habitual es un sitio que devuelve su página 404 en HTML con estado 200 en /llms.txt, y las herramientas lo interpretan como "el archivo existe".

¿Cuál es el equivalente en SEO clásico?

llms.txt se solapa con cosas que el SEO ya pide: una estructura del sitio clara, títulos descriptivos y un sitemap XML. La diferencia es el público. Un sitemap lista todo para los rastreadores de los buscadores; llms.txt elige las pocas páginas que un modelo debería leer primero. Si no tienes ninguno de los dos, empieza por el sitemap y un buen enlazado interno, porque ayudan por igual a Google y a los sistemas de IA.

¿Debería tener uno tu web?

Añade un llms.txt si:

  • los desarrolladores, los agentes o los asistentes de IA son una parte importante de tu público,
  • tienes documentación o páginas de referencia difíciles de encontrar desde la navegación,
  • puedes mantenerlo actualizado.

Déjalo para más adelante si tu sitio tiene problemas más básicos, como páginas bloqueadas para los rastreadores o contenido que solo aparece después de ejecutar JavaScript. Arregla eso primero.

Puedes comprobar si tu sitio publica un llms.txt, y si es un archivo real y no una página HTML de reserva, con nuestro comprobador gratuito de robots.txt y llms.txt. También muestra cuáles de los rastreadores de IA de nuestra lista de rastreadores permite tu robots.txt.

Preguntas frecuentes

¿llms.txt es un estándar oficial?

No. Es una propuesta de la comunidad publicada en llmstxt.org. A diferencia de robots.txt, que se estandarizó como RFC 9309 en 2022, llms.txt no tiene detrás ningún organismo formal de estandarización.

¿llms.txt ayuda con Google AI Overviews?

Google ha dicho que no usa llms.txt. AI Overviews forma parte de la Búsqueda de Google, así que se aplican los fundamentos habituales de la Búsqueda: la página debe estar indexada y ser apta para mostrar un fragmento.

¿Dónde pongo el archivo?

En la raíz de tu dominio: https://yourdomain.com/llms.txt. Debe devolver un estado 200 con Markdown o texto plano, no una página HTML.

¿llms.txt puede bloquear a los rastreadores de IA?

No. Los rastreadores se bloquean y se permiten en robots.txt. llms.txt solo describe el contenido.

Analiza tu sitio web