Réponse courte : llms.txt est un simple fichier Markdown placé à la racine de votre site (/llms.txt) qui liste vos pages les plus utiles avec une description d'une ligne, pour qu'un modèle de langage puisse les trouver sans analyser toute votre navigation. C'est une proposition, pas un standard. Il se rédige en une heure, il aide certains outils d'IA, et Google a indiqué ne pas l'utiliser.
Qu'est-ce que llms.txt exactement ?
llms.txt a été proposé en septembre 2024 par Jeremy Howard, d'Answer.AI, et il est documenté sur llmstxt.org. L'idée est simple : les pages web sont conçues pour les humains et les navigateurs, remplies de menus, de scripts et de mise en page. Un modèle de langage qui lit votre site dispose d'une fenêtre de contexte limitée : une carte courte et choisie du type "voici qui nous sommes et voici les pages qui valent la peine d'être lues" est donc plus facile à exploiter que du HTML brut.
Le fichier est du Markdown ordinaire avec une forme fixe :
- un H1 avec le nom du site ou du projet,
- une courte citation en bloc qui résume de quoi il s'agit,
- des paragraphes de contexte facultatifs,
- des sections H2 contenant des listes de liens, chacun avec une courte note.
Certains sites publient aussi llms-full.txt, un fichier unique contenant le texte intégral de leurs pages clés. Cette variante est courante dans la documentation pour développeurs.
Que ne fait pas llms.txt ?
C'est là que naît l'essentiel de la confusion, il vaut donc la peine d'être précis.
- Il ne contrôle pas l'accès. llms.txt ne peut ni autoriser ni bloquer un robot. L'accès est décidé par le robots.txt, un fichier distinct qui a un autre rôle. Nous comparons les deux dans llms.txt ou robots.txt.
- Ce n'est pas un signal de classement pour Google. Des représentants de Google ont déclaré publiquement que la recherche Google n'utilise pas llms.txt. Voyez-le comme un positionnement pour les outils d'IA, pas comme une tactique SEO pour Google.
- Rien ne garantit qu'il soit lu. Aucun grand fournisseur d'IA ne s'est engagé à lire llms.txt sur chaque site. Certains outils et agents pour développeurs le lisent quand on les dirige vers un site.
llms.txt est donc un indice utile, pas un interrupteur.
Qui tire vraiment profit d'un fichier llms.txt ?
Ce sont surtout les sites lus par des développeurs, des agents et des outils de documentation : produits SaaS, API, projets open source et bases de connaissances. Quand quelqu'un demande à un assistant de code IA de "lire la documentation de X", un llms.txt propre lui évite de deviner lesquelles de vos 400 pages sont la vraie référence.
Pour un commerce local ou un petit blog, le bénéfice est moindre. Il nuit rarement, mais il ne réparera pas un site que les moteurs de réponse ne peuvent déjà pas lire. Si votre contenu n'est rendu que par JavaScript, ou s'il est bloqué dans le robots.txt, llms.txt ne le sauvera pas.
Comment rédiger un bon llms.txt ?
Faites court et honnête. Un fichier utile pour un site SaaS pourrait ressembler à ceci :
# ExampleCo
> ExampleCo is invoicing software for freelancers in the EU.
## Product
- [Features](https://example.com/features): what the product does
- [Pricing](https://example.com/pricing): plans and what each includes
## Help
- [Getting started](https://example.com/docs/start): set up in ten minutes
- [VAT rules](https://example.com/docs/vat): how EU VAT is calculated
Règles pratiques :
- Ne liez que des pages qui répondent à de vraies questions. Une liste de toutes les URL est un sitemap, pas un guide.
- Rédigez chaque note comme une phrase simple qui dit ce que contient la page.
- Gardez le fichier synchronisé avec votre site. Un llms.txt périmé qui pointe vers des pages 404 est pire que pas de fichier du tout.
- Servez-le en texte brut ou en Markdown avec un statut 200. Erreur fréquente : un site qui renvoie sa page 404 HTML avec un statut 200 à l'adresse
/llms.txt, que les outils interprètent alors comme "le fichier existe".
Quel est l'équivalent en SEO classique ?
llms.txt recoupe ce que le SEO demande déjà : une structure de site claire, des titres descriptifs et un sitemap XML. La différence, c'est le public. Un sitemap liste tout pour les robots des moteurs de recherche ; llms.txt choisit les quelques pages qu'un modèle devrait lire en premier. Si vous n'avez ni l'un ni l'autre, commencez par le sitemap et un bon maillage interne, car ils aident autant Google que les systèmes d'IA.
Votre site doit-il en avoir un ?
Ajoutez un llms.txt si :
- les développeurs, les agents ou les assistants IA représentent une part significative de votre audience,
- vous avez de la documentation ou des pages de référence difficiles à trouver depuis la navigation,
- vous pouvez le tenir à jour.
Laissez-le de côté pour l'instant si votre site a des problèmes plus élémentaires, comme des pages bloquées pour les robots ou du contenu qui n'apparaît qu'après l'exécution du JavaScript. Corrigez-les d'abord.
Vous pouvez vérifier si votre site publie un llms.txt, et s'il s'agit d'un vrai fichier plutôt que d'une page HTML de repli, avec notre vérificateur gratuit robots.txt et llms.txt. Il montre aussi lesquels des robots d'IA de notre liste des robots votre robots.txt autorise.
Questions fréquentes
llms.txt est-il un standard officiel ?
Non. C'est une proposition communautaire publiée sur llmstxt.org. Contrairement au robots.txt, standardisé en 2022 sous le nom RFC 9309, llms.txt n'a derrière lui aucun organisme de normalisation officiel.
llms.txt aide-t-il pour Google AI Overviews ?
Google a indiqué ne pas utiliser llms.txt. AI Overviews fait partie de la recherche Google : les fondamentaux habituels de la recherche s'appliquent, la page doit être indexée et pouvoir afficher un extrait.
Où placer le fichier ?
À la racine de votre domaine : https://yourdomain.com/llms.txt. Il doit renvoyer un statut 200 avec du Markdown ou du texte brut, pas une page HTML.
llms.txt peut-il bloquer les robots d'IA ?
Non. On bloque et on autorise les robots dans le robots.txt. llms.txt ne fait que décrire le contenu.
