llms.txt est un fichier Markdown placé à la racine d'un site pour aider les LLM et les agents à naviguer son contenu. Il ne bloque aucun crawler, ne garantit aucune citation, et Google a confirmé ne pas l'utiliser. Le publier coûte une heure et ne peut pas nuire — mais ce n'est pas un levier de visibilité IA, et cette entrée de glossaire explique pourquoi.
- Ce que c'est : un sommaire Markdown pour agents, proposé par Jeremy Howard (Answer.AI) en septembre 2024.
- Ce que ça fait : faciliter la navigation des LLM à l'inférence — adoption réelle surtout dans les docs techniques.
- Ce que ça ne fait pas : bloquer des crawlers (rôle de robots.txt) ou garantir des citations (aucune preuve publique).
- La position de Google : « aucun système IA n'utilise llms.txt » (John Mueller, 2025).
- Verdict : pari asymétrique — publiez-le, mais n'en attendez rien côté citations.
C'est quoi, un fichier llms.txt ?
llms.txt est une proposition de standard publiée le 3 septembre 2024 par Jeremy Howard, cofondateur d'Answer.AI. Le principe tient en une phrase : un fichier Markdown servi à la racine du site (/llms.txt) qui décrit le site et liste ses pages clés, pour qu'un LLM ou un agent sache où aller sans parser tout le HTML.
Le format est volontairement minimal : un titre avec le nom du site, un blockquote de résumé, puis des sections de liens vers des versions Markdown propres des pages importantes. Une variante, llms-full.txt, inline carrément tout le contenu dans un seul fichier.
Le problème adressé est réel : les context windows restent limitées, et une page HTML moderne — nav, cookie banners, JS — est un gouffre à tokens pour un agent. llms.txt, c'est la table des matières qu'on lui tend.
Que fait concrètement llms.txt ?
Une seule chose : de la navigation. À l'inférence — au moment où un agent visite votre site pour accomplir une tâche —, le fichier lui donne un plan curaté plutôt qu'un crawl à l'aveugle.
L'adoption réelle confirme ce périmètre. Confidentielle au lancement, elle a décollé quand Mintlify a déployé llms.txt sur l'ensemble des docs qu'il héberge en novembre 2024 : du jour au lendemain, des milliers de sites de documentation — dont ceux d'Anthropic et de Cursor — l'ont exposé. Le pattern dominant en 2026 reste celui-là : des docs techniques consommées par des assistants de code et des agents. Pas des sites marketing récoltant des citations.
Qu'est-ce que llms.txt ne fait pas ?
llms.txt ne bloque aucun crawler — il n'a aucun pouvoir d'interdiction, c'est le rôle de robots.txt. Il ne garantit aucune citation dans ChatGPT, Claude ou Gemini. Et ce n'est pas un standard adopté : c'est une proposition, sans engagement public des principaux fournisseurs de modèles.
Le malentendu vient du nom. « .txt à la racine » évoque robots.txt, donc un mécanisme de contrôle. C'est l'inverse : robots.txt est impératif (des directives que les bots respectent — ou pas), llms.txt est purement déclaratif. Rien dans le fichier n'empêche, n'autorise ou ne priorise quoi que ce soit. Un crawler qui veut ignorer votre llms.txt l'ignore ; un crawler qui veut crawler votre site n'a jamais eu besoin de lui.
llms.txt est une carte tendue aux agents — pas un péage, pas un panneau d'interdiction, et encore moins un ticket de citation.
Que dit Google de llms.txt ?
Google est le seul acteur majeur à avoir pris position publiquement, et la position est sans ambiguïté. John Mueller a confirmé en 2025 : « à ma connaissance, aucun système IA n'utilise actuellement llms.txt », en comparant le fichier à la meta keywords — ce tag que les moteurs ignorent depuis vingt ans précisément parce qu'il est auto-déclaré, donc manipulable.
L'anecdote qui résume tout : en décembre 2025, un llms.txt est brièvement apparu sur les propres docs développeur de Google — ajouté automatiquement par leur CMS — avant d'être retiré le jour même. Même chez Google, le fichier existait sans que personne ne le consomme.
Côté OpenAI et Anthropic : aucune preuve publique solide que leurs systèmes consomment llms.txt pour le retrieval ou le choix des citations. Vos logs montrent peut-être des hits de crawlers sur /llms.txt — un hit n'est pas un usage.
Où llms.txt s'insère-t-il dans la stack robots.txt / pay-per-crawl / RSL ?
La bonne façon de juger llms.txt, c'est de le remettre à sa place dans la stack des protocoles qui régissent la relation site ↔ IA en 2026. Chaque étage a un rôle distinct — et llms.txt occupe le plus modeste.
Sources : proposition llms.txt (Answer.AI, sept. 2024) ; déclarations John Mueller (Google, 2025) ; Cloudflare (pay-per-crawl ; Markdown for Agents, fév. 2026) ; RSL Collective (sept. 2025).
Deux mouvements récents éclairent la trajectoire. D'un côté, la monétisation s'industrialise : le pay-per-crawl de Cloudflare répond aux crawlers non payeurs par un HTTP 402, et RSL — lancé en septembre 2025 avec Reddit, Yahoo, Medium ou Quora — déclare des conditions de licence directement dans robots.txt. De l'autre, la navigation se déplace vers l'infra : en février 2026, Cloudflare a lancé Markdown for Agents, qui convertit n'importe quelle page HTML en Markdown à la volée dès qu'un agent le demande — jusqu'à 80 % de tokens en moins, selon Cloudflare —, couplé à des Content Signals qui déclarent les usages autorisés (training, search, inférence).
Lecture honnête : le standard de fait se construit dans l'infra, pas dans un fichier déclaratif. Et la question de l'étage accès — ouvrir, fermer ou faire payer — mérite son propre article : bloquer les crawlers IA est l'erreur GEO la plus chère de 2026.
Faut-il publier un llms.txt en 2026 ?
Oui — à condition d'être lucide sur ce qu'on achète. Le raisonnement est un pari asymétrique classique : coût quasi nul (une heure de curation, génération automatique sur la plupart des plateformes de docs), downside inexistant, et upside gratuit si le standard finit par être consommé. On ne publie pas llms.txt parce qu'on a des preuves ; on le publie parce que ne pas le faire n'économise presque rien.
- +Coût quasi nul : une heure de curation, génération automatique sur la plupart des plateformes docs
- +Aucun downside connu : au pire le fichier est ignoré, au mieux il est lu
- +Déjà consommé par certains outils dev (assistants de code, agents qui lisent les docs)
- +Vous êtes prêt si le standard décolle — l'option ne coûte rien
- −Aucune preuve publique d'impact sur les citations ChatGPT, Claude ou Gemini
- −Google a confirmé ne pas l'utiliser (John Mueller, 2025)
- −Un fichier périmé désinforme les agents — maintenance obligatoire
- −Effet placebo : cocher llms.txt et croire son GEO « fait »
Comment publier un llms.txt propre ?
- 011 — GénérerSur une plateforme de docs (Mintlify et consorts), le fichier est généré automatiquement. Sinon, à la main : un titre, un blockquote de résumé, des sections de liens. Une heure, pas plus.
- 022 — CuraterLes pages clés seulement : docs, API, pricing, pages produit. Un llms.txt n'est pas un dump de sitemap — c'est une sélection éditoriale pour un lecteur à context window limitée.
- 033 — Servir du Markdown propreChaque lien doit pointer vers un contenu réellement lisible par un agent : version .md ou HTML minimal. Un sommaire vers des pages illisibles ne sert à rien.
- 044 — MaintenirIntégrer le fichier à la checklist de release. Un llms.txt périmé est pire que pas de llms.txt : il désinforme les rares agents qui le lisent.
llms.txt suffit-il pour être cité par ChatGPT ?
Non — et c'est le point le plus important de cette entrée de glossaire. Les citations LLM ne se déclarent pas, elles se gagnent. Les modèles choisissent qui citer en fonction du signal de demande : les mentions et les recherches qui gravitent autour d'une marque sur les sources qu'ils consultent réellement — Reddit, comparatifs, presse, forums. Un fichier auto-déclaré à la racine de votre propre site n'a jamais fait partie de cette équation, pour la raison exacte qu'invoque Mueller : tout signal contrôlé à 100 % par l'éditeur finit ignoré. Le mécanisme complet est décortiqué dans comment les LLM choisissent qui citer.
llms.txt dans une stratégie GEO
C'est exactement la séparation que fait Rankfeed : d'un côté mesurer votre taux de citation réel dans ChatGPT, Claude, Grok et DeepSeek ; de l'autre l'activer en générant du signal de demande sur votre cluster sémantique. La mécanique est détaillée sur comment ça marche.
llms.txt se publie en une heure ; il ne fera pas citer votre marque. Si vous voulez savoir où vous en êtes — et agir dessus —, Rankfeed mesure votre visibilité sur 4 modèles et active le signal de demande qui fait citer. Voir les tarifs.
FAQ
Pour aller plus loin
- Bloquer les crawlers IA : l'erreur GEO la plus chère de 2026 — l'étage accès / monétisation de la stack.
- GEO, AEO, LLMO : le dictionnaire — situer llms.txt dans le vocabulaire de la visibilité IA.
Pour mesurer puis activer votre visibilité IA : Comment ça marche.
