TÁCTICAS LLM SEEDING5 juin 2026· 9 min de lectura

Bloquear los crawlers IA: el error GEO que Amazon acaba de pagar en citas de ChatGPT

Amazon restringió cerca de 50 crawlers IA — y vio caer sus citas en ChatGPT en favor de Walmart. Field-note sobre el trade-off pay-per-crawl: monetizar el crawl o seguir siendo citado, y cómo decidir crawler por crawler.

T
Tomáš Havel
Lead Researcher · GEO methodology
Bloquear los crawlers IA: el error GEO que Amazon acaba de pagar en citas de ChatGPT

Amazon blindó su robots.txt contra los crawlers de OpenAI; unas semanas después, su cuota de citas en ChatGPT se desplomaba y Walmart ocupaba su lugar. Bloquear los crawlers IA protege el contenido — pero el precio se paga en visibilidad LLM, justo donde tus compradores hacen ahora sus preguntas. Field-note sobre el arbitraje monetización vs citas, y la única manera sana de zanjarlo: crawler por crawler, nunca «la IA» en bloque.

TL;DR
  • Amazon restringió cerca de 50 user-agents IA en su robots.txt (incluidos los tres crawlers de OpenAI) → su cuota de citas en ChatGPT cayó; Walmart, que siguió abierto, la superó.
  • Bloquear un crawler de retrieval = salir de las respuestas, no solo del training de los futuros modelos.
  • Pay-per-crawl (Cloudflare, julio de 2025): Allow / Charge / Block por crawler, respuesta HTTP 402 — y bloqueo de los crawlers IA por defecto para los nuevos clientes.
  • La granularidad correcta de decisión: el crawler, no «la IA» — training, retrieval y agentes no tienen el mismo coste GEO.
  • Regla de arbitraje: si el contenido es tu producto → Charge o Block; si el contenido es tu distribución → Allow.

¿Qué pasó entre Amazon y Walmart en ChatGPT?

El resumen cabe en una frase: Amazon le cerró la puerta a los crawlers de OpenAI, y ChatGPT empezó a recomendar Walmart. En octubre de 2025, Amazon dominaba las citas de ChatGPT entre los grandes retailers. Entre finales de 2025 y enero de 2026, su robots.txt se endureció — ChatGPT-User, OAI-SearchBot, luego decenas de bots más — hasta restringir cerca de 50 user-agents IA, incluidos los tres crawlers de OpenAI. Ya en noviembre, su cuota de citas en ChatGPT caía con claridad. Walmart, que siguió abierto y firmó un partnership Instant Checkout con OpenAI, llenó el hueco y se puso en cabeza en ChatGPT.

EL CASO AMAZON, EN CIFRAS
~50
user-agents IA restringidos en el robots.txt de Amazon (ene. 2026)
3/3
crawlers de OpenAI bloqueados: GPTBot, ChatGPT-User, OAI-SearchBot
~50 M
consultas de shopping al día vía los agentes de ChatGPT, según OpenAI
1 mes
entre el pico de citas de Amazon (oct. 2025) y la caída (nov. 2025)

Fuentes: robots.txt de Amazon (Modern Retail, Search Engine Land), datos de citas de ChatGPT Q1 2026, working paper del equipo Economic Research de OpenAI.

Un detalle que importa: en Google AI Overviews, Amazon conserva una ventaja cómoda. El bloqueo solo costó allí donde se aplica — cada plataforma construye sus citas de forma distinta, y por eso seguimos la fragmentación de las citas IA por plataforma como un tema con entidad propia.

¿Por qué bloquear los crawlers IA hunde las citas LLM?

Porque una respuesta de ChatGPT o Perplexity no se genera solo desde la memoria del modelo: en las consultas comerciales, el modelo lanza un retrieval en tiempo real, lee las fuentes accesibles y cita lo que pudo leer. Bloquear el crawler de retrieval es borrarse a uno mismo de la lista de fuentes candidatas en el momento de la consulta. El modelo no «castiga» a nadie — simplemente cita a quien sigue siendo legible.

Walmart no se volvió mejor en noviembre de 2025. Simplemente siguió accesible mientras Amazon se volvía ilegible. La señal de demanda que construyes no sirve de nada si, en el momento del retrieval, el crawler se topa con un 403.

Amazon protegió su catálogo; Walmart se quedó con sus citas. El robots.txt ya no es una línea de higiene técnica — es una decisión de distribución.

Es lo que medimos en Rankfeed: la tasa de citación por modelo es el revelador inmediato de este tipo de decisión de infraestructura.

¿El pay-per-crawl de Cloudflare cambia el arbitraje?

Lo hace explícito — y eso ya es mucho. El 1 de julio de 2025, Cloudflare anunció pay-per-crawl: un modelo en el que cada petición de un crawler IA recibe o bien el contenido (HTTP 200, con intención de pago declarada), o bien una respuesta HTTP 402 Payment Required con el precio. Tres opciones por crawler: Allow (acceso gratuito), Charge (pago al precio fijado para el dominio), Block (rechazo, sin opción de pago). La autenticación de los crawlers se apoya en firmas criptográficas para frenar el spoofing de user-agent, y Cloudflare actúa como merchant of record.

El mismo día, otro giro más estructural: Cloudflare bloquea ahora los crawlers IA por defecto para sus nuevos clientes. La web pasó de un modelo opt-out (todo es crawleable salvo rechazo) a un modelo opt-in (nada es crawleable sin acuerdo).

!
Revisa tu propia config

Si tu sitio se puso detrás de Cloudflare después de julio de 2025, puede que estés bloqueando los crawlers IA sin haberlo decidido nunca. Una auditoría del AI Crawl Control y de tus logs se impone antes de preguntarte por qué tu tasa de citación se estanca.

En cuanto a ingresos, seamos honestos: el precio unitario de un crawl es bajo, y la monetización solo se vuelve significativa con un volumen de crawl muy grande — un perfil de gran medio, no de SaaS. La ecuación completa, coste GEO incluido:

OPCIÓN PAY-PER-CRAWLEFECTO INMEDIATOCOSTE GEO
AllowAcceso gratuito para el crawlerNinguno — sigues dentro del retrieval
ChargeHTTP 402 + precio por peticiónVariable — los crawlers que se niegan a pagar te sacan de sus fuentes
BlockAcceso denegado, sin opción de pagoMáximo — salida progresiva de las respuestas IA, en favor de los competidores abiertos

¿Hay que bloquear todos los crawlers IA o decidir crawler por crawler?

Crawler por crawler, sin excepción. «Bloquear la IA» es una categoría que no existe técnicamente: un crawler de training, un crawler de search y un agente que actúa por un usuario no tienen ni el mismo papel ni el mismo coste cuando se les cierra la puerta.

TIPO DE CRAWLEREJEMPLOSDECISIÓN POR DEFECTO
TrainingGPTBot, ClaudeBotNegociable — Charge o Block si el contenido es tu activo principal
Search / retrievalOAI-SearchBot, PerplexityBotAllow — es el que produce las citas
Agente / acción de usuarioChatGPT-UserAllow si vendes algo; bloquearlo cierra el canal agéntico

La secuencia operativa, tal como la desplegamos:

  1. 01
    1 — Inventariar
    Logs de servidor + AI Crawl Control: qué crawlers IA pasan realmente, con qué frecuencia, por qué páginas. Decidir sin ese inventario es decidir a ciegas.
  2. 02
    2 — Clasificar
    Cada user-agent en una de las tres familias: training, retrieval, agente. La documentación de cada editor (OpenAI, Anthropic, Perplexity) precisa el papel de cada bot.
  3. 03
    3 — Fijar una baseline de citas
    Tasa de citación por modelo sobre tu clúster de consultas, ANTES de tocar el robots.txt. Sin baseline, imposible atribuir una caída al bloqueo.
  4. 04
    4 — Decidir y monitorizar
    Aplicar la política crawler por crawler y seguir el efecto sobre las citas semana a semana — exactamente el tipo de bucle que describe nuestra página Cómo funciona.

Y una aclaración necesaria: llms.txt no restringe ningún crawler. Es un fichero de navegación, no un control de acceso — documentamos el mito y la realidad de llms.txt en detalle. El control real vive en robots.txt (directiva voluntaria) y a nivel WAF/CDN (aplicación forzada).

¿Cómo arbitrar monetización vs visibilidad GEO para tu negocio?

La regla cabe en una pregunta: ¿tu contenido es el producto o la distribución? Un medio vende su contenido — cada crawl no compensado es una pérdida neta, y Charge es una posición racional. Un SaaS B2B o una marca de e-commerce vende otra cosa: el contenido es solo el vehículo que mete la marca en las respuestas IA. Cerrarlo es cerrar tu propio canal de adquisición — y con el auge del comercio agéntico vía ChatGPT, bloquear ChatGPT-User equivale a negarle la entrada a un cliente que llega con la tarjeta en la mano.

Arbitrar monetización vs visibilidad

HACER
Decidir crawler por crawler, familia por familia. Dejar pasar los crawlers de retrieval que producen las citas. Fijar una baseline de tasa de citación antes de cualquier cambio en el robots.txt. Reservar Charge/Block para los crawlers de training, y solo si el contenido es el activo. Re-verificar la config de Cloudflare heredada del default-block.
EVITAR
Bloquear «todos los bots IA» con un clic. Confundir crawler de training con crawler de retrieval. Creer que llms.txt bloquea algo. Sacrificar citas LLM por un microingreso de crawl cuando el contenido no es el producto. Descubrir la caída de citas tres meses después, sin baseline para probarla.

El caso Amazon ni siquiera es un «error» en sentido estricto: Amazon puede permitirse perder citas en ChatGPT, su marca genera su propia demanda. Tú, probablemente no. Cada cita perdida es una recomendación transferida a un competidor — y el retrieval no guarda memoria de tu antigua posición.

FAQ

No, y ese es el matiz clave. GPTBot alimenta el training de los futuros modelos: bloquearlo no afecta a las respuestas de hoy. Son OAI-SearchBot y ChatGPT-User los que alimentan el retrieval en tiempo real — bloquearlos saca el sitio de las citas y del shopping de ChatGPT, como mostró el caso Amazon.

Para seguir leyendo

MIDE ANTES DE BLOQUEAR

Tu política de crawl es una decisión GEO. Fija tu baseline de citas en ChatGPT, Claude, Grok y DeepSeek, y pilota el efecto de cada cambio — Cómo funciona detalla el bucle medir → actuar, y los Precios arrancan sin compromiso.

T
Tomáš Havel
LEAD RESEARCHER · GEO METHODOLOGY

Haz que tu marca aparezca en ChatGPT, Claude, Grok y DeepSeek.

Rankfeed alimenta los 4 modelos con tu cluster semántico. Warm-up 14 días, feed continuo, desde 79 €/mes.

Arrancar mi feed →
DIGEST GEO SEMANAL

Recibe la próxima guía GEO

Un email todos los domingos. Tácticas LLM Seeding, cifras del mercado IA, cero marketing.