llms.txt es un archivo Markdown colocado en la raíz de un sitio para ayudar a los LLM y a los agentes a navegar su contenido. No bloquea ningún crawler, no garantiza ninguna cita y Google ha confirmado que no lo usa. Publicarlo cuesta una hora y no puede hacer daño — pero no es una palanca de visibilidad IA, y esta entrada de glosario explica por qué.
- Qué es: un índice Markdown para agentes, propuesto por Jeremy Howard (Answer.AI) en septiembre de 2024.
- Qué hace: facilitar la navegación de los LLM en inferencia — adopción real sobre todo en docs técnicas.
- Qué no hace: bloquear crawlers (papel de robots.txt) ni garantizar citas (ninguna prueba pública).
- La posición de Google: «ningún sistema IA usa llms.txt» (John Mueller, 2025).
- Veredicto: apuesta asimétrica — publícalo, pero no esperes nada en el frente de las citas.
¿Qué es un archivo llms.txt?
llms.txt es una propuesta de estándar publicada el 3 de septiembre de 2024 por Jeremy Howard, cofundador de Answer.AI. El principio cabe en una frase: un archivo Markdown servido en la raíz del sitio (/llms.txt) que describe el sitio y lista sus páginas clave, para que un LLM o un agente sepa adónde ir sin parsear todo el HTML.
El formato es deliberadamente mínimo: un título con el nombre del sitio, un blockquote de resumen y secciones de enlaces hacia versiones Markdown limpias de las páginas importantes. Una variante, llms-full.txt, directamente inlinea todo el contenido en un único archivo.
El problema que aborda es real: las context windows siguen siendo limitadas, y una página HTML moderna — nav, banners de cookies, JS — es un sumidero de tokens para un agente. llms.txt es el índice que se le tiende.
¿Qué hace llms.txt en concreto?
Una sola cosa: navegación. En inferencia — en el momento en que un agente visita tu sitio para cumplir una tarea —, el archivo le da un plan curado en lugar de un crawl a ciegas.
La adopción real confirma ese perímetro. Confidencial en el lanzamiento, despegó cuando Mintlify desplegó llms.txt en todas las docs que aloja en noviembre de 2024: de un día para otro, miles de sitios de documentación — incluidos los de Anthropic y Cursor — lo expusieron. El patrón dominante en 2026 sigue siendo ese: docs técnicas consumidas por asistentes de código y agentes. No sitios de marketing cosechando citas.
¿Qué es lo que llms.txt no hace?
llms.txt no bloquea ningún crawler — no tiene ningún poder de prohibición, ese es el papel de robots.txt. No garantiza ninguna cita en ChatGPT, Claude o Gemini. Y no es un estándar adoptado: es una propuesta, sin compromiso público de los principales proveedores de modelos.
El malentendido viene del nombre. «.txt en la raíz» evoca robots.txt y, por tanto, un mecanismo de control. Es justo lo contrario: robots.txt es imperativo (directivas que los bots respetan — o no), llms.txt es puramente declarativo. Nada en el archivo impide, autoriza ni prioriza nada. Un crawler que quiera ignorar tu llms.txt lo ignora; un crawler que quiera crawlear tu sitio nunca lo ha necesitado.
llms.txt es un mapa tendido a los agentes — no un peaje, no una señal de prohibido y mucho menos un ticket de citación.
¿Qué dice Google sobre llms.txt?
Google es el único actor de peso que se ha posicionado públicamente, y la posición no deja lugar a dudas. John Mueller confirmó en 2025: «hasta donde yo sé, ningún sistema IA usa actualmente llms.txt», comparando el archivo con la meta keywords — esa etiqueta que los buscadores ignoran desde hace veinte años precisamente porque es autodeclarada y, por tanto, manipulable.
La anécdota que lo resume todo: en diciembre de 2025, un llms.txt apareció brevemente en las propias docs para desarrolladores de Google — añadido automáticamente por su CMS — antes de ser retirado el mismo día. Incluso en Google, el archivo existía sin que nadie lo consumiera.
Del lado de OpenAI y Anthropic: ninguna prueba pública sólida de que sus sistemas consuman llms.txt para el retrieval o la elección de citas. Puede que tus logs muestren hits de crawlers en /llms.txt — un hit no es un uso.
¿Dónde encaja llms.txt en el stack robots.txt / pay-per-crawl / RSL?
La forma correcta de juzgar llms.txt es devolverlo a su sitio dentro del stack de protocolos que regulan la relación sitio ↔ IA en 2026. Cada piso tiene un papel distinto — y llms.txt ocupa el más modesto.
Fuentes: propuesta llms.txt (Answer.AI, sept. 2024); declaraciones de John Mueller (Google, 2025); Cloudflare (pay-per-crawl; Markdown for Agents, feb. 2026); RSL Collective (sept. 2025).
Dos movimientos recientes iluminan la trayectoria. Por un lado, la monetización se industrializa: el pay-per-crawl de Cloudflare responde a los crawlers que no pagan con un HTTP 402, y RSL — lanzado en septiembre de 2025 con Reddit, Yahoo, Medium o Quora — declara condiciones de licencia directamente en robots.txt. Por otro, la navegación se desplaza hacia la infra: en febrero de 2026, Cloudflare lanzó Markdown for Agents, que convierte cualquier página HTML en Markdown al vuelo en cuanto un agente lo pide — hasta un 80 % menos de tokens, según Cloudflare —, acoplado a unos Content Signals que declaran los usos autorizados (training, search, inferencia).
Lectura honesta: el estándar de facto se está construyendo en la infra, no en un archivo declarativo. Y la cuestión del piso de acceso — abrir, cerrar o cobrar — merece su propio artículo: bloquear los crawlers IA es el error GEO más caro de 2026.
¿Hay que publicar un llms.txt en 2026?
Sí — a condición de tener claro qué se está comprando. El razonamiento es una apuesta asimétrica clásica: coste casi nulo (una hora de curación, generación automática en la mayoría de las plataformas de docs), downside inexistente y upside gratis si el estándar acaba siendo consumido. No se publica llms.txt porque haya pruebas; se publica porque no hacerlo no ahorra casi nada.
- +Coste casi nulo: una hora de curación, generación automática en la mayoría de las plataformas de docs
- +Ningún downside conocido: en el peor de los casos el archivo se ignora, en el mejor se lee
- +Ya lo consumen algunas herramientas dev (asistentes de código, agentes que leen las docs)
- +Estás listo si el estándar despega — la opción no cuesta nada
- −Ninguna prueba pública de impacto en las citas de ChatGPT, Claude o Gemini
- −Google ha confirmado que no lo usa (John Mueller, 2025)
- −Un archivo desactualizado desinforma a los agentes — mantenimiento obligatorio
- −Efecto placebo: marcar la casilla llms.txt y dar el GEO por «hecho»
¿Cómo publicar un llms.txt limpio?
- 011 — GenerarEn una plataforma de docs (Mintlify y compañía), el archivo se genera automáticamente. Si no, a mano: un título, un blockquote de resumen, secciones de enlaces. Una hora, no más.
- 022 — CurarSolo las páginas clave: docs, API, pricing, páginas de producto. Un llms.txt no es un volcado de sitemap — es una selección editorial para un lector con context window limitada.
- 033 — Servir Markdown limpioCada enlace debe apuntar a un contenido realmente legible por un agente: versión .md o HTML mínimo. Un índice hacia páginas ilegibles no sirve de nada.
- 044 — MantenerIntegrar el archivo en la checklist de release. Un llms.txt desactualizado es peor que ninguno: desinforma a los pocos agentes que lo leen.
¿Basta llms.txt para que ChatGPT te cite?
No — y es el punto más importante de esta entrada de glosario. Las citas LLM no se declaran, se ganan. Los modelos eligen a quién citar en función de la señal de demanda: las menciones y las búsquedas que gravitan en torno a una marca en las fuentes que realmente consultan — Reddit, comparativas, prensa, foros. Un archivo autodeclarado en la raíz de tu propio sitio nunca ha formado parte de esa ecuación, por la razón exacta que invoca Mueller: toda señal controlada al 100 % por el editor acaba ignorada. El mecanismo completo está desmontado en cómo los LLM eligen a quién citar.
llms.txt en una estrategia GEO
Esa es exactamente la separación que hace Rankfeed: por un lado, medir tu tasa de citación real en ChatGPT, Claude, Grok y DeepSeek; por otro, activarla generando señal de demanda sobre tu clúster semántico. La mecánica está detallada en cómo funciona.
llms.txt se publica en una hora; no hará que citen tu marca. Si quieres saber dónde estás — y actuar sobre ello —, Rankfeed mide tu visibilidad en 4 modelos y activa la señal de demanda que hace citar. Ver precios.
FAQ
Para seguir leyendo
- Bloquear los crawlers IA: el error GEO más caro de 2026 — el piso de acceso / monetización del stack.
- GEO, AEO, LLMO: el diccionario — situar llms.txt en el vocabulario de la visibilidad IA.
Para medir y luego activar tu visibilidad IA: Cómo funciona.
