Amazon blindó su robots.txt contra los crawlers de OpenAI; unas semanas después, su cuota de citas en ChatGPT se desplomaba y Walmart ocupaba su lugar. Bloquear los crawlers IA protege el contenido — pero el precio se paga en visibilidad LLM, justo donde tus compradores hacen ahora sus preguntas. Field-note sobre el arbitraje monetización vs citas, y la única manera sana de zanjarlo: crawler por crawler, nunca «la IA» en bloque.
- Amazon restringió cerca de 50 user-agents IA en su robots.txt (incluidos los tres crawlers de OpenAI) → su cuota de citas en ChatGPT cayó; Walmart, que siguió abierto, la superó.
- Bloquear un crawler de retrieval = salir de las respuestas, no solo del training de los futuros modelos.
- Pay-per-crawl (Cloudflare, julio de 2025): Allow / Charge / Block por crawler, respuesta HTTP 402 — y bloqueo de los crawlers IA por defecto para los nuevos clientes.
- La granularidad correcta de decisión: el crawler, no «la IA» — training, retrieval y agentes no tienen el mismo coste GEO.
- Regla de arbitraje: si el contenido es tu producto → Charge o Block; si el contenido es tu distribución → Allow.
¿Qué pasó entre Amazon y Walmart en ChatGPT?
El resumen cabe en una frase: Amazon le cerró la puerta a los crawlers de OpenAI, y ChatGPT empezó a recomendar Walmart. En octubre de 2025, Amazon dominaba las citas de ChatGPT entre los grandes retailers. Entre finales de 2025 y enero de 2026, su robots.txt se endureció — ChatGPT-User, OAI-SearchBot, luego decenas de bots más — hasta restringir cerca de 50 user-agents IA, incluidos los tres crawlers de OpenAI. Ya en noviembre, su cuota de citas en ChatGPT caía con claridad. Walmart, que siguió abierto y firmó un partnership Instant Checkout con OpenAI, llenó el hueco y se puso en cabeza en ChatGPT.
Fuentes: robots.txt de Amazon (Modern Retail, Search Engine Land), datos de citas de ChatGPT Q1 2026, working paper del equipo Economic Research de OpenAI.
Un detalle que importa: en Google AI Overviews, Amazon conserva una ventaja cómoda. El bloqueo solo costó allí donde se aplica — cada plataforma construye sus citas de forma distinta, y por eso seguimos la fragmentación de las citas IA por plataforma como un tema con entidad propia.
¿Por qué bloquear los crawlers IA hunde las citas LLM?
Porque una respuesta de ChatGPT o Perplexity no se genera solo desde la memoria del modelo: en las consultas comerciales, el modelo lanza un retrieval en tiempo real, lee las fuentes accesibles y cita lo que pudo leer. Bloquear el crawler de retrieval es borrarse a uno mismo de la lista de fuentes candidatas en el momento de la consulta. El modelo no «castiga» a nadie — simplemente cita a quien sigue siendo legible.
Walmart no se volvió mejor en noviembre de 2025. Simplemente siguió accesible mientras Amazon se volvía ilegible. La señal de demanda que construyes no sirve de nada si, en el momento del retrieval, el crawler se topa con un 403.
Amazon protegió su catálogo; Walmart se quedó con sus citas. El robots.txt ya no es una línea de higiene técnica — es una decisión de distribución.
Es lo que medimos en Rankfeed: la tasa de citación por modelo es el revelador inmediato de este tipo de decisión de infraestructura.
¿El pay-per-crawl de Cloudflare cambia el arbitraje?
Lo hace explícito — y eso ya es mucho. El 1 de julio de 2025, Cloudflare anunció pay-per-crawl: un modelo en el que cada petición de un crawler IA recibe o bien el contenido (HTTP 200, con intención de pago declarada), o bien una respuesta HTTP 402 Payment Required con el precio. Tres opciones por crawler: Allow (acceso gratuito), Charge (pago al precio fijado para el dominio), Block (rechazo, sin opción de pago). La autenticación de los crawlers se apoya en firmas criptográficas para frenar el spoofing de user-agent, y Cloudflare actúa como merchant of record.
El mismo día, otro giro más estructural: Cloudflare bloquea ahora los crawlers IA por defecto para sus nuevos clientes. La web pasó de un modelo opt-out (todo es crawleable salvo rechazo) a un modelo opt-in (nada es crawleable sin acuerdo).
Si tu sitio se puso detrás de Cloudflare después de julio de 2025, puede que estés bloqueando los crawlers IA sin haberlo decidido nunca. Una auditoría del AI Crawl Control y de tus logs se impone antes de preguntarte por qué tu tasa de citación se estanca.
En cuanto a ingresos, seamos honestos: el precio unitario de un crawl es bajo, y la monetización solo se vuelve significativa con un volumen de crawl muy grande — un perfil de gran medio, no de SaaS. La ecuación completa, coste GEO incluido:
¿Hay que bloquear todos los crawlers IA o decidir crawler por crawler?
Crawler por crawler, sin excepción. «Bloquear la IA» es una categoría que no existe técnicamente: un crawler de training, un crawler de search y un agente que actúa por un usuario no tienen ni el mismo papel ni el mismo coste cuando se les cierra la puerta.
La secuencia operativa, tal como la desplegamos:
- 011 — InventariarLogs de servidor + AI Crawl Control: qué crawlers IA pasan realmente, con qué frecuencia, por qué páginas. Decidir sin ese inventario es decidir a ciegas.
- 022 — ClasificarCada user-agent en una de las tres familias: training, retrieval, agente. La documentación de cada editor (OpenAI, Anthropic, Perplexity) precisa el papel de cada bot.
- 033 — Fijar una baseline de citasTasa de citación por modelo sobre tu clúster de consultas, ANTES de tocar el robots.txt. Sin baseline, imposible atribuir una caída al bloqueo.
- 044 — Decidir y monitorizarAplicar la política crawler por crawler y seguir el efecto sobre las citas semana a semana — exactamente el tipo de bucle que describe nuestra página Cómo funciona.
Y una aclaración necesaria: llms.txt no restringe ningún crawler. Es un fichero de navegación, no un control de acceso — documentamos el mito y la realidad de llms.txt en detalle. El control real vive en robots.txt (directiva voluntaria) y a nivel WAF/CDN (aplicación forzada).
¿Cómo arbitrar monetización vs visibilidad GEO para tu negocio?
La regla cabe en una pregunta: ¿tu contenido es el producto o la distribución? Un medio vende su contenido — cada crawl no compensado es una pérdida neta, y Charge es una posición racional. Un SaaS B2B o una marca de e-commerce vende otra cosa: el contenido es solo el vehículo que mete la marca en las respuestas IA. Cerrarlo es cerrar tu propio canal de adquisición — y con el auge del comercio agéntico vía ChatGPT, bloquear ChatGPT-User equivale a negarle la entrada a un cliente que llega con la tarjeta en la mano.
Arbitrar monetización vs visibilidad
El caso Amazon ni siquiera es un «error» en sentido estricto: Amazon puede permitirse perder citas en ChatGPT, su marca genera su propia demanda. Tú, probablemente no. Cada cita perdida es una recomendación transferida a un competidor — y el retrieval no guarda memoria de tu antigua posición.
FAQ
Para seguir leyendo
- llms.txt: mito vs realidad — lo que el fichero hace de verdad (y lo que no).
- La fragmentación de las citas IA por plataforma — por qué Amazon cae en ChatGPT pero aguanta en AI Overviews.
- El comercio agéntico de ChatGPT y el protocolo ACP — lo que se juega detrás del bloqueo de ChatGPT-User.
Tu política de crawl es una decisión GEO. Fija tu baseline de citas en ChatGPT, Claude, Grok y DeepSeek, y pilota el efecto de cada cambio — Cómo funciona detalla el bucle medir → actuar, y los Precios arrancan sin compromiso.
