Réponse courte : c'est le robots.txt qui décide si les systèmes d'IA peuvent lire votre site, parce qu'il contrôle quels robots peuvent récupérer vos pages. Le llms.txt ne fait que décrire les pages qui valent la peine d'être lues. Si le robots.txt bloque le robot d'un moteur de réponse, aucun llms.txt ne vous fera citer par ce moteur. Commencez par le robots.txt ; ajoutez le llms.txt comme guide.
Que fait chaque fichier ?
| robots.txt | llms.txt | |
|---|---|---|
| Rôle | Autoriser ou bloquer des robots | Indiquer aux modèles les pages clés |
| Statut | Standard (RFC 9309, 2022) | Proposition communautaire (2024) |
| Lu par | Tout robot respectueux des règles | Certains outils et agents d'IA |
| Utilisé par la recherche Google | Oui | Google dit que non |
| Peut bloquer l'accès | Oui | Non |
| Format | Règles User-agent et Disallow |
Markdown avec des liens |
Les deux fichiers ne sont pas concurrents. Le robots.txt est une porte ; le llms.txt est un plan que vous laissez sur la table une fois les visiteurs entrés.
Pourquoi le robots.txt compte-t-il davantage pour la visibilité dans l'IA ?
Parce que l'accès vient en premier. Chaque moteur de réponse IA utilise son propre robot, et chaque robot consulte le robots.txt avant de récupérer quoi que ce soit :
- La recherche de ChatGPT utilise OAI-SearchBot. OpenAI indique que les sites qui l'excluent n'apparaîtront pas dans les réponses de la recherche de ChatGPT.
- Perplexity utilise PerplexityBot pour ses résultats de recherche.
- La recherche de Claude utilise Claude-SearchBot.
- Google AI Overviews fait partie de la recherche et s'appuie sur Googlebot.
Si l'un d'eux est interdit, le moteur concerné ne peut pas récupérer vos pages pour les citer. Un llms.txt magnifiquement rédigé n'y change rien, car le robot ne franchit jamais la porte.
Quels bots bloquer et lesquels autoriser ?
C'est la décision qui compte, et la plupart des fichiers robots.txt se trompent en traitant tous les bots d'IA de la même façon. Il en existe deux sortes :
- Les robots des moteurs de réponse récupèrent des pages pour les afficher et les citer avec un lien dans les réponses. Les bloquer vous retire des résultats de ce moteur.
- Les robots d'entraînement uniquement collectent du texte pour entraîner des modèles. Les bloquer est un choix de licence. Cela ne vous retire pas des réponses.
Les noms se confondent facilement. GPTBot est le robot d'entraînement d'OpenAI ; OAI-SearchBot est celui qui alimente la recherche de ChatGPT. ClaudeBot est le robot d'entraînement d'Anthropic ; Claude-SearchBot alimente la recherche. Google-Extended et Applebot-Extended ne sont même pas des robots, mais des tokens robots.txt qui contrôlent l'usage pour l'entraînement, et Google comme Apple affirment qu'ils n'ont pas d'effet sur la recherche.
Une politique courante et raisonnable pour une entreprise qui veut être citée sans servir à l'entraînement ressemble à ceci :
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: *
Allow: /
Les robots des moteurs de réponse, dont OAI-SearchBot, Claude-SearchBot et PerplexityBot, restent ainsi autorisés par le groupe générique, tandis que vous refusez les usages d'entraînement nommés. Refuser ou non l'entraînement vous appartient ; l'essentiel est de le décider délibérément. Notre liste des robots d'IA montre chaque agent que nous suivons et le groupe auquel il appartient.
Quelles erreurs voyons-nous le plus souvent ?
- Bloquer avec un joker.
User-agent: *avecDisallow: /bloque tous les robots qui n'ont pas leur propre groupe, moteurs de réponse compris. - Copier une "liste de blocage IA" trouvée sur un forum. Ces listes incluent souvent OAI-SearchBot et PerplexityBot à côté des bots d'entraînement, et retirent discrètement le site des réponses IA.
- Croire que le robots.txt retire des pages des index. Il contrôle l'exploration. Une URL bloquée peut quand même apparaître si d'autres pages pointent vers elle. Pour l'écarter, utilisez
noindexsur une page explorable. - Un llms.txt qui est en réalité une page HTML. Beaucoup de sites renvoient leur page 404 avec un statut 200 à l'adresse
/llms.txt. Les outils qui ne regardent que le code de statut croient que le fichier existe.
Où le llms.txt aide-t-il encore ?
Une fois l'accès correct, le llms.txt peut faciliter le travail d'un modèle sur les sites volumineux ou techniques : il pointe vers les pages qui répondent à de vraies questions au lieu de laisser le modèle deviner à partir de la navigation. Il est surtout utile pour la documentation, les API et les produits SaaS. Nous expliquons comment en rédiger un dans qu'est-ce que llms.txt.
Quel est le point de vue du SEO classique ?
Le robots.txt fait partie du SEO depuis des décennies, et les mêmes règles s'appliquent : ne bloquez pas les pages que vous voulez voir indexées, ne l'utilisez pas pour cacher du contenu sensible et gardez-le assez court pour pouvoir l'auditer. La nouveauté, c'est qu'il y a désormais beaucoup plus de user-agents à prendre en compte, et la différence entre un bot d'entraînement et un bot de recherche change ce que vous coûte un blocage.
Comment vérifier votre propre site ?
Notre vérificateur gratuit robots.txt et llms.txt lit votre robots.txt, vous dit quels robots de moteurs de réponse et d'entraînement vous autorisez, et vérifie si votre llms.txt est un vrai fichier. Il suffit d'une requête, sans inscription.
Questions fréquentes
Si je bloque GPTBot, ChatGPT arrêtera-t-il de me citer ?
Non. GPTBot sert à l'entraînement. La recherche de ChatGPT utilise OAI-SearchBot. Bloquer GPTBot vous exclut de l'entraînement, pas de la recherche de ChatGPT.
Ai-je besoin d'un llms.txt si mon robots.txt est correct ?
Pas strictement. Un robots.txt correct est l'exigence ; le llms.txt est un guide facultatif qui aide certains outils d'IA sur les sites volumineux ou techniques.
Google lit-il le llms.txt ?
Google a indiqué que la recherche Google n'utilise pas le llms.txt. En revanche, elle lit bien le robots.txt.
Le robots.txt peut-il protéger un contenu privé ?
Non. Le robots.txt est public et demande seulement aux robots de ne pas récupérer les pages. Tout contenu privé exige une authentification.
