GLOSSAIRE5 juin 2026· 8 min de lecture

llms.txt : la définition honnête — ce que le fichier fait, ce qu'il ne fera jamais pour vos citations IA

llms.txt n'est ni un robots.txt ni un ticket d'entrée dans ChatGPT. Définition honnête : ce que le fichier Markdown fait pour les agents, ce qu'il ne fait pas, et s'il faut en publier un en 2026.

T
Tomáš Havel
Lead Researcher · GEO methodology
llms.txt : la définition honnête — ce que le fichier fait, ce qu'il ne fera jamais pour vos citations IA

llms.txt est un fichier Markdown placé à la racine d'un site pour aider les LLM et les agents à naviguer son contenu. Il ne bloque aucun crawler, ne garantit aucune citation, et Google a confirmé ne pas l'utiliser. Le publier coûte une heure et ne peut pas nuire — mais ce n'est pas un levier de visibilité IA, et cette entrée de glossaire explique pourquoi.

TL;DR
  • Ce que c'est : un sommaire Markdown pour agents, proposé par Jeremy Howard (Answer.AI) en septembre 2024.
  • Ce que ça fait : faciliter la navigation des LLM à l'inférence — adoption réelle surtout dans les docs techniques.
  • Ce que ça ne fait pas : bloquer des crawlers (rôle de robots.txt) ou garantir des citations (aucune preuve publique).
  • La position de Google : « aucun système IA n'utilise llms.txt » (John Mueller, 2025).
  • Verdict : pari asymétrique — publiez-le, mais n'en attendez rien côté citations.

C'est quoi, un fichier llms.txt ?

llms.txt est une proposition de standard publiée le 3 septembre 2024 par Jeremy Howard, cofondateur d'Answer.AI. Le principe tient en une phrase : un fichier Markdown servi à la racine du site (/llms.txt) qui décrit le site et liste ses pages clés, pour qu'un LLM ou un agent sache où aller sans parser tout le HTML.

Le format est volontairement minimal : un titre avec le nom du site, un blockquote de résumé, puis des sections de liens vers des versions Markdown propres des pages importantes. Une variante, llms-full.txt, inline carrément tout le contenu dans un seul fichier.

Le problème adressé est réel : les context windows restent limitées, et une page HTML moderne — nav, cookie banners, JS — est un gouffre à tokens pour un agent. llms.txt, c'est la table des matières qu'on lui tend.

llms.txt — le format, en 30 secondes
$curl -s https://exemple.com/llms.txt
># Exemple — plateforme de facturation B2B
>> SaaS de facturation pour PME européennes. Docs, API, tarifs.
>## Docs
>- [Quickstart](https://exemple.com/docs/quickstart.md) : intégration en 10 min
>- [API Reference](https://exemple.com/docs/api.md) : endpoints REST
>## Optional
>- [Changelog](https://exemple.com/changelog.md)

Que fait concrètement llms.txt ?

Une seule chose : de la navigation. À l'inférence — au moment où un agent visite votre site pour accomplir une tâche —, le fichier lui donne un plan curaté plutôt qu'un crawl à l'aveugle.

L'adoption réelle confirme ce périmètre. Confidentielle au lancement, elle a décollé quand Mintlify a déployé llms.txt sur l'ensemble des docs qu'il héberge en novembre 2024 : du jour au lendemain, des milliers de sites de documentation — dont ceux d'Anthropic et de Cursor — l'ont exposé. Le pattern dominant en 2026 reste celui-là : des docs techniques consommées par des assistants de code et des agents. Pas des sites marketing récoltant des citations.

Qu'est-ce que llms.txt ne fait pas ?

!
Trois confusions qui coûtent cher

llms.txt ne bloque aucun crawler — il n'a aucun pouvoir d'interdiction, c'est le rôle de robots.txt. Il ne garantit aucune citation dans ChatGPT, Claude ou Gemini. Et ce n'est pas un standard adopté : c'est une proposition, sans engagement public des principaux fournisseurs de modèles.

Le malentendu vient du nom. « .txt à la racine » évoque robots.txt, donc un mécanisme de contrôle. C'est l'inverse : robots.txt est impératif (des directives que les bots respectent — ou pas), llms.txt est purement déclaratif. Rien dans le fichier n'empêche, n'autorise ou ne priorise quoi que ce soit. Un crawler qui veut ignorer votre llms.txt l'ignore ; un crawler qui veut crawler votre site n'a jamais eu besoin de lui.

llms.txt est une carte tendue aux agents — pas un péage, pas un panneau d'interdiction, et encore moins un ticket de citation.

Que dit Google de llms.txt ?

Google est le seul acteur majeur à avoir pris position publiquement, et la position est sans ambiguïté. John Mueller a confirmé en 2025 : « à ma connaissance, aucun système IA n'utilise actuellement llms.txt », en comparant le fichier à la meta keywords — ce tag que les moteurs ignorent depuis vingt ans précisément parce qu'il est auto-déclaré, donc manipulable.

L'anecdote qui résume tout : en décembre 2025, un llms.txt est brièvement apparu sur les propres docs développeur de Google — ajouté automatiquement par leur CMS — avant d'être retiré le jour même. Même chez Google, le fichier existait sans que personne ne le consomme.

Côté OpenAI et Anthropic : aucune preuve publique solide que leurs systèmes consomment llms.txt pour le retrieval ou le choix des citations. Vos logs montrent peut-être des hits de crawlers sur /llms.txt — un hit n'est pas un usage.

LLMS.TXT EN 3 CHIFFRES
2024
année de la proposition (Jeremy Howard, Answer.AI)
0
système IA majeur confirmé comme consommateur du fichier (John Mueller, Google, 2025)
−80 %
de tokens consommés quand une page est servie en Markdown plutôt qu'en HTML (Cloudflare)

Où llms.txt s'insère-t-il dans la stack robots.txt / pay-per-crawl / RSL ?

La bonne façon de juger llms.txt, c'est de le remettre à sa place dans la stack des protocoles qui régissent la relation site ↔ IA en 2026. Chaque étage a un rôle distinct — et llms.txt occupe le plus modeste.

PROTOCOLERÔLESTATUT 2026
robots.txtContrôle d'accès : qui peut crawler quoiStandard de facto, respecté par les principaux bots
llms.txtNavigation : sommaire Markdown pour les agentsProposition (2024), adoption concentrée sur les docs techniques
Pay-per-crawl (Cloudflare)Monétisation : payer la requête ou recevoir un HTTP 402Bêta, réservé aux sites derrière Cloudflare
RSL (Really Simple Licensing)Licence : conditions d'usage déclarées via robots.txtLancé en sept. 2025 (Reddit, Yahoo, Medium, Quora…)
Markdown for Agents + Content SignalsConversion HTML→Markdown à la volée + signaux d'usage IALancé par Cloudflare en février 2026

Sources : proposition llms.txt (Answer.AI, sept. 2024) ; déclarations John Mueller (Google, 2025) ; Cloudflare (pay-per-crawl ; Markdown for Agents, fév. 2026) ; RSL Collective (sept. 2025).

Deux mouvements récents éclairent la trajectoire. D'un côté, la monétisation s'industrialise : le pay-per-crawl de Cloudflare répond aux crawlers non payeurs par un HTTP 402, et RSL — lancé en septembre 2025 avec Reddit, Yahoo, Medium ou Quora — déclare des conditions de licence directement dans robots.txt. De l'autre, la navigation se déplace vers l'infra : en février 2026, Cloudflare a lancé Markdown for Agents, qui convertit n'importe quelle page HTML en Markdown à la volée dès qu'un agent le demande — jusqu'à 80 % de tokens en moins, selon Cloudflare —, couplé à des Content Signals qui déclarent les usages autorisés (training, search, inférence).

Lecture honnête : le standard de fait se construit dans l'infra, pas dans un fichier déclaratif. Et la question de l'étage accès — ouvrir, fermer ou faire payer — mérite son propre article : bloquer les crawlers IA est l'erreur GEO la plus chère de 2026.

Faut-il publier un llms.txt en 2026 ?

Oui — à condition d'être lucide sur ce qu'on achète. Le raisonnement est un pari asymétrique classique : coût quasi nul (une heure de curation, génération automatique sur la plupart des plateformes de docs), downside inexistant, et upside gratuit si le standard finit par être consommé. On ne publie pas llms.txt parce qu'on a des preuves ; on le publie parce que ne pas le faire n'économise presque rien.

POUR
  • +Coût quasi nul : une heure de curation, génération automatique sur la plupart des plateformes docs
  • +Aucun downside connu : au pire le fichier est ignoré, au mieux il est lu
  • +Déjà consommé par certains outils dev (assistants de code, agents qui lisent les docs)
  • +Vous êtes prêt si le standard décolle — l'option ne coûte rien
CONTRE
  • Aucune preuve publique d'impact sur les citations ChatGPT, Claude ou Gemini
  • Google a confirmé ne pas l'utiliser (John Mueller, 2025)
  • Un fichier périmé désinforme les agents — maintenance obligatoire
  • Effet placebo : cocher llms.txt et croire son GEO « fait »

Comment publier un llms.txt propre ?

  1. 01
    1 — Générer
    Sur une plateforme de docs (Mintlify et consorts), le fichier est généré automatiquement. Sinon, à la main : un titre, un blockquote de résumé, des sections de liens. Une heure, pas plus.
  2. 02
    2 — Curater
    Les pages clés seulement : docs, API, pricing, pages produit. Un llms.txt n'est pas un dump de sitemap — c'est une sélection éditoriale pour un lecteur à context window limitée.
  3. 03
    3 — Servir du Markdown propre
    Chaque lien doit pointer vers un contenu réellement lisible par un agent : version .md ou HTML minimal. Un sommaire vers des pages illisibles ne sert à rien.
  4. 04
    4 — Maintenir
    Intégrer le fichier à la checklist de release. Un llms.txt périmé est pire que pas de llms.txt : il désinforme les rares agents qui le lisent.

llms.txt suffit-il pour être cité par ChatGPT ?

Non — et c'est le point le plus important de cette entrée de glossaire. Les citations LLM ne se déclarent pas, elles se gagnent. Les modèles choisissent qui citer en fonction du signal de demande : les mentions et les recherches qui gravitent autour d'une marque sur les sources qu'ils consultent réellement — Reddit, comparatifs, presse, forums. Un fichier auto-déclaré à la racine de votre propre site n'a jamais fait partie de cette équation, pour la raison exacte qu'invoque Mueller : tout signal contrôlé à 100 % par l'éditeur finit ignoré. Le mécanisme complet est décortiqué dans comment les LLM choisissent qui citer.

llms.txt dans une stratégie GEO

À FAIRE
Publier llms.txt comme hygiène technique, à côté d'un robots.txt réfléchi. Garder le fichier court et curaté. Mesurer votre taux de citation réel dans ChatGPT, Claude, Grok et DeepSeek. Investir l'essentiel de l'effort dans le signal de demande — ce qui fait effectivement citer une marque.
À ÉVITER
Confondre llms.txt et robots.txt. Y dumper tout le sitemap. Le présenter au board comme une stratégie de visibilité IA. Attendre des citations d'un fichier que les principaux modèles ne lisent pas. Croire son GEO « fait » parce qu'un fichier est en ligne.

C'est exactement la séparation que fait Rankfeed : d'un côté mesurer votre taux de citation réel dans ChatGPT, Claude, Grok et DeepSeek ; de l'autre l'activer en générant du signal de demande sur votre cluster sémantique. La mécanique est détaillée sur comment ça marche.

PUBLIEZ LE FICHIER, TRAVAILLEZ LE SIGNAL

llms.txt se publie en une heure ; il ne fera pas citer votre marque. Si vous voulez savoir où vous en êtes — et agir dessus —, Rankfeed mesure votre visibilité sur 4 modèles et active le signal de demande qui fait citer. Voir les tarifs.

FAQ

Non. robots.txt contrôle l'accès des crawlers (allow/disallow) et reste le seul des deux à être largement respecté. llms.txt ne bloque rien : c'est un sommaire Markdown purement déclaratif. Les deux coexistent — l'un gère qui entre, l'autre propose un plan de lecture.

Pour aller plus loin

Pour mesurer puis activer votre visibilité IA : Comment ça marche.

T
Tomáš Havel
LEAD RESEARCHER · GEO METHODOLOGY

Faites apparaître votre marque dans ChatGPT, Claude, Grok et DeepSeek.

Rankfeed nourrit les 4 modèles avec votre cluster sémantique. Warm-up 14 jours, feed continu, dès 79 €/mois.

Démarrer mon feed →
DIGEST GEO HEBDOMADAIRE

Recevez le prochain guide GEO

Un email tous les dimanches. Tactiques LLM Seeding, chiffres du marché IA, zéro marketing.