GLOSARIO5 juin 2026· 8 min de lectura

llms.txt: la definición honesta — qué hace el archivo y qué no hará nunca por tus citas IA

llms.txt no es un robots.txt ni un ticket de entrada a ChatGPT. Definición honesta: qué hace el archivo Markdown para los agentes, qué no hace y si conviene publicar uno en 2026.

T
Tomáš Havel
Lead Researcher · GEO methodology
llms.txt: la definición honesta — qué hace el archivo y qué no hará nunca por tus citas IA

llms.txt es un archivo Markdown colocado en la raíz de un sitio para ayudar a los LLM y a los agentes a navegar su contenido. No bloquea ningún crawler, no garantiza ninguna cita y Google ha confirmado que no lo usa. Publicarlo cuesta una hora y no puede hacer daño — pero no es una palanca de visibilidad IA, y esta entrada de glosario explica por qué.

TL;DR
  • Qué es: un índice Markdown para agentes, propuesto por Jeremy Howard (Answer.AI) en septiembre de 2024.
  • Qué hace: facilitar la navegación de los LLM en inferencia — adopción real sobre todo en docs técnicas.
  • Qué no hace: bloquear crawlers (papel de robots.txt) ni garantizar citas (ninguna prueba pública).
  • La posición de Google: «ningún sistema IA usa llms.txt» (John Mueller, 2025).
  • Veredicto: apuesta asimétrica — publícalo, pero no esperes nada en el frente de las citas.

¿Qué es un archivo llms.txt?

llms.txt es una propuesta de estándar publicada el 3 de septiembre de 2024 por Jeremy Howard, cofundador de Answer.AI. El principio cabe en una frase: un archivo Markdown servido en la raíz del sitio (/llms.txt) que describe el sitio y lista sus páginas clave, para que un LLM o un agente sepa adónde ir sin parsear todo el HTML.

El formato es deliberadamente mínimo: un título con el nombre del sitio, un blockquote de resumen y secciones de enlaces hacia versiones Markdown limpias de las páginas importantes. Una variante, llms-full.txt, directamente inlinea todo el contenido en un único archivo.

El problema que aborda es real: las context windows siguen siendo limitadas, y una página HTML moderna — nav, banners de cookies, JS — es un sumidero de tokens para un agente. llms.txt es el índice que se le tiende.

llms.txt — el formato, en 30 segundos
$curl -s https://ejemplo.com/llms.txt
># Ejemplo — plataforma de facturación B2B
>> SaaS de facturación para pymes europeas. Docs, API, precios.
>## Docs
>- [Quickstart](https://ejemplo.com/docs/quickstart.md): integración en 10 min
>- [API Reference](https://ejemplo.com/docs/api.md): endpoints REST
>## Optional
>- [Changelog](https://ejemplo.com/changelog.md)

¿Qué hace llms.txt en concreto?

Una sola cosa: navegación. En inferencia — en el momento en que un agente visita tu sitio para cumplir una tarea —, el archivo le da un plan curado en lugar de un crawl a ciegas.

La adopción real confirma ese perímetro. Confidencial en el lanzamiento, despegó cuando Mintlify desplegó llms.txt en todas las docs que aloja en noviembre de 2024: de un día para otro, miles de sitios de documentación — incluidos los de Anthropic y Cursor — lo expusieron. El patrón dominante en 2026 sigue siendo ese: docs técnicas consumidas por asistentes de código y agentes. No sitios de marketing cosechando citas.

¿Qué es lo que llms.txt no hace?

!
Tres confusiones que salen caras

llms.txt no bloquea ningún crawler — no tiene ningún poder de prohibición, ese es el papel de robots.txt. No garantiza ninguna cita en ChatGPT, Claude o Gemini. Y no es un estándar adoptado: es una propuesta, sin compromiso público de los principales proveedores de modelos.

El malentendido viene del nombre. «.txt en la raíz» evoca robots.txt y, por tanto, un mecanismo de control. Es justo lo contrario: robots.txt es imperativo (directivas que los bots respetan — o no), llms.txt es puramente declarativo. Nada en el archivo impide, autoriza ni prioriza nada. Un crawler que quiera ignorar tu llms.txt lo ignora; un crawler que quiera crawlear tu sitio nunca lo ha necesitado.

llms.txt es un mapa tendido a los agentes — no un peaje, no una señal de prohibido y mucho menos un ticket de citación.

¿Qué dice Google sobre llms.txt?

Google es el único actor de peso que se ha posicionado públicamente, y la posición no deja lugar a dudas. John Mueller confirmó en 2025: «hasta donde yo sé, ningún sistema IA usa actualmente llms.txt», comparando el archivo con la meta keywords — esa etiqueta que los buscadores ignoran desde hace veinte años precisamente porque es autodeclarada y, por tanto, manipulable.

La anécdota que lo resume todo: en diciembre de 2025, un llms.txt apareció brevemente en las propias docs para desarrolladores de Google — añadido automáticamente por su CMS — antes de ser retirado el mismo día. Incluso en Google, el archivo existía sin que nadie lo consumiera.

Del lado de OpenAI y Anthropic: ninguna prueba pública sólida de que sus sistemas consuman llms.txt para el retrieval o la elección de citas. Puede que tus logs muestren hits de crawlers en /llms.txt — un hit no es un uso.

LLMS.TXT EN 3 CIFRAS
2024
año de la propuesta (Jeremy Howard, Answer.AI)
0
sistemas IA de primer nivel confirmados como consumidores del archivo (John Mueller, Google, 2025)
−80 %
de tokens consumidos cuando una página se sirve en Markdown en vez de HTML (Cloudflare)

¿Dónde encaja llms.txt en el stack robots.txt / pay-per-crawl / RSL?

La forma correcta de juzgar llms.txt es devolverlo a su sitio dentro del stack de protocolos que regulan la relación sitio ↔ IA en 2026. Cada piso tiene un papel distinto — y llms.txt ocupa el más modesto.

PROTOCOLOPAPELESTADO 2026
robots.txtControl de acceso: quién puede crawlear quéEstándar de facto, respetado por los principales bots
llms.txtNavegación: índice Markdown para los agentesPropuesta (2024), adopción concentrada en las docs técnicas
Pay-per-crawl (Cloudflare)Monetización: pagar la petición o recibir un HTTP 402Beta, reservado a los sitios detrás de Cloudflare
RSL (Really Simple Licensing)Licencia: condiciones de uso declaradas vía robots.txtLanzado en sept. de 2025 (Reddit, Yahoo, Medium, Quora…)
Markdown for Agents + Content SignalsConversión HTML→Markdown al vuelo + señales de uso IALanzado por Cloudflare en febrero de 2026

Fuentes: propuesta llms.txt (Answer.AI, sept. 2024); declaraciones de John Mueller (Google, 2025); Cloudflare (pay-per-crawl; Markdown for Agents, feb. 2026); RSL Collective (sept. 2025).

Dos movimientos recientes iluminan la trayectoria. Por un lado, la monetización se industrializa: el pay-per-crawl de Cloudflare responde a los crawlers que no pagan con un HTTP 402, y RSL — lanzado en septiembre de 2025 con Reddit, Yahoo, Medium o Quora — declara condiciones de licencia directamente en robots.txt. Por otro, la navegación se desplaza hacia la infra: en febrero de 2026, Cloudflare lanzó Markdown for Agents, que convierte cualquier página HTML en Markdown al vuelo en cuanto un agente lo pide — hasta un 80 % menos de tokens, según Cloudflare —, acoplado a unos Content Signals que declaran los usos autorizados (training, search, inferencia).

Lectura honesta: el estándar de facto se está construyendo en la infra, no en un archivo declarativo. Y la cuestión del piso de acceso — abrir, cerrar o cobrar — merece su propio artículo: bloquear los crawlers IA es el error GEO más caro de 2026.

¿Hay que publicar un llms.txt en 2026?

Sí — a condición de tener claro qué se está comprando. El razonamiento es una apuesta asimétrica clásica: coste casi nulo (una hora de curación, generación automática en la mayoría de las plataformas de docs), downside inexistente y upside gratis si el estándar acaba siendo consumido. No se publica llms.txt porque haya pruebas; se publica porque no hacerlo no ahorra casi nada.

A FAVOR
  • +Coste casi nulo: una hora de curación, generación automática en la mayoría de las plataformas de docs
  • +Ningún downside conocido: en el peor de los casos el archivo se ignora, en el mejor se lee
  • +Ya lo consumen algunas herramientas dev (asistentes de código, agentes que leen las docs)
  • +Estás listo si el estándar despega — la opción no cuesta nada
EN CONTRA
  • Ninguna prueba pública de impacto en las citas de ChatGPT, Claude o Gemini
  • Google ha confirmado que no lo usa (John Mueller, 2025)
  • Un archivo desactualizado desinforma a los agentes — mantenimiento obligatorio
  • Efecto placebo: marcar la casilla llms.txt y dar el GEO por «hecho»

¿Cómo publicar un llms.txt limpio?

  1. 01
    1 — Generar
    En una plataforma de docs (Mintlify y compañía), el archivo se genera automáticamente. Si no, a mano: un título, un blockquote de resumen, secciones de enlaces. Una hora, no más.
  2. 02
    2 — Curar
    Solo las páginas clave: docs, API, pricing, páginas de producto. Un llms.txt no es un volcado de sitemap — es una selección editorial para un lector con context window limitada.
  3. 03
    3 — Servir Markdown limpio
    Cada enlace debe apuntar a un contenido realmente legible por un agente: versión .md o HTML mínimo. Un índice hacia páginas ilegibles no sirve de nada.
  4. 04
    4 — Mantener
    Integrar el archivo en la checklist de release. Un llms.txt desactualizado es peor que ninguno: desinforma a los pocos agentes que lo leen.

¿Basta llms.txt para que ChatGPT te cite?

No — y es el punto más importante de esta entrada de glosario. Las citas LLM no se declaran, se ganan. Los modelos eligen a quién citar en función de la señal de demanda: las menciones y las búsquedas que gravitan en torno a una marca en las fuentes que realmente consultan — Reddit, comparativas, prensa, foros. Un archivo autodeclarado en la raíz de tu propio sitio nunca ha formado parte de esa ecuación, por la razón exacta que invoca Mueller: toda señal controlada al 100 % por el editor acaba ignorada. El mecanismo completo está desmontado en cómo los LLM eligen a quién citar.

llms.txt en una estrategia GEO

HACER
Publicar llms.txt como higiene técnica, junto a un robots.txt bien pensado. Mantener el archivo corto y curado. Medir tu tasa de citación real en ChatGPT, Claude, Grok y DeepSeek. Invertir el grueso del esfuerzo en la señal de demanda — lo que de verdad hace que una marca sea citada.
EVITAR
Confundir llms.txt con robots.txt. Volcar ahí todo el sitemap. Presentárselo al board como una estrategia de visibilidad IA. Esperar citas de un archivo que los principales modelos no leen. Dar el GEO por «hecho» porque hay un archivo en línea.

Esa es exactamente la separación que hace Rankfeed: por un lado, medir tu tasa de citación real en ChatGPT, Claude, Grok y DeepSeek; por otro, activarla generando señal de demanda sobre tu clúster semántico. La mecánica está detallada en cómo funciona.

PUBLICA EL ARCHIVO, TRABAJA LA SEÑAL

llms.txt se publica en una hora; no hará que citen tu marca. Si quieres saber dónde estás — y actuar sobre ello —, Rankfeed mide tu visibilidad en 4 modelos y activa la señal de demanda que hace citar. Ver precios.

FAQ

No. robots.txt controla el acceso de los crawlers (allow/disallow) y sigue siendo el único de los dos ampliamente respetado. llms.txt no bloquea nada: es un índice Markdown puramente declarativo. Ambos coexisten — uno gestiona quién entra, el otro propone un plan de lectura.

Para seguir leyendo

Para medir y luego activar tu visibilidad IA: Cómo funciona.

T
Tomáš Havel
LEAD RESEARCHER · GEO METHODOLOGY

Haz que tu marca aparezca en ChatGPT, Claude, Grok y DeepSeek.

Rankfeed alimenta los 4 modelos con tu cluster semántico. Warm-up 14 días, feed continuo, desde 79 €/mes.

Arrancar mi feed →
DIGEST GEO SEMANAL

Recibe la próxima guía GEO

Un email todos los domingos. Tácticas LLM Seeding, cifras del mercado IA, cero marketing.