Amazon ha blindato il suo robots.txt contro i crawler di OpenAI; poche settimane dopo, la sua quota di citazioni ChatGPT crollava e Walmart ne prendeva il posto. Bloccare i crawler IA protegge i contenuti — ma il prezzo si paga in visibilità LLM, lì dove i tuoi acquirenti ormai pongono le loro domande. Field-note sul trade-off monetizzazione vs citazioni, e sull'unico modo sano di scioglierlo: crawler per crawler, mai «l'IA» in blocco.
- Amazon ha ristretto quasi 50 user-agent IA nel suo robots.txt (compresi i tre crawler OpenAI) → la sua quota di citazioni ChatGPT è crollata; Walmart, rimasto aperto, l'ha superata.
- Bloccare un crawler di retrieval = uscire dalle risposte, non solo dal training dei modelli futuri.
- Pay-per-crawl (Cloudflare, luglio 2025): Allow / Charge / Block per ogni crawler, risposta HTTP 402 — e blocco dei crawler IA di default per i nuovi clienti.
- La grana giusta della decisione: il crawler, non «l'IA» — training, retrieval e agenti non hanno lo stesso costo GEO.
- Regola di arbitraggio: se il contenuto è il tuo prodotto → Charge o Block; se il contenuto è la tua distribuzione → Allow.
Cos'è successo tra Amazon e Walmart su ChatGPT?
Il riassunto sta in una frase: Amazon ha chiuso la porta ai crawler di OpenAI, e ChatGPT ha iniziato a raccomandare Walmart. A ottobre 2025 Amazon dominava le citazioni ChatGPT tra i grandi retailer. Tra fine 2025 e gennaio 2026 il suo robots.txt si è irrigidito — ChatGPT-User, OAI-SearchBot, poi decine di altri bot — fino a restringere quasi 50 user-agent IA, compresi i tre crawler di OpenAI. Già a novembre la sua quota di citazioni ChatGPT calava nettamente. Walmart, rimasto aperto e firmatario di una partnership Instant Checkout con OpenAI, ha colmato il vuoto e preso la testa su ChatGPT.
Fonti: robots.txt di Amazon (Modern Retail, Search Engine Land), dati di citazioni ChatGPT Q1 2026, working paper del team Economic Research di OpenAI.
Dettaglio che conta: su Google AI Overviews, Amazon mantiene un vantaggio comodo. Il blocco è costato solo lì dove si applica — ogni piattaforma costruisce le sue citazioni in modo diverso, ed è esattamente per questo che seguiamo la frammentazione delle citazioni IA per piattaforma come un tema a sé.
Perché bloccare i crawler IA fa crollare le citazioni LLM?
Perché una risposta di ChatGPT o Perplexity non viene generata dalla sola memoria del modello: sulle query commerciali, il modello lancia un retrieval in tempo reale, legge le fonti accessibili, poi cita ciò che ha potuto leggere. Bloccare il crawler di retrieval significa togliersi da soli dalla lista delle fonti candidate al momento della query. Il modello non «punisce» nessuno — cita semplicemente chi resta leggibile.
Walmart non è diventato più bravo a novembre 2025. È solo rimasto accessibile mentre Amazon diventava illeggibile. Il segnale di domanda che costruisci non serve a niente se, al momento del retrieval, il crawler sbatte contro un 403.
Amazon ha protetto il suo catalogo; Walmart si è preso le sue citazioni. Il robots.txt non è più una riga di igiene tecnica — è una decisione di distribuzione.
È quello che misuriamo in Rankfeed: il tasso di citazione per modello è il rivelatore immediato di questo tipo di decisione infrastrutturale.
Il pay-per-crawl di Cloudflare cambia il trade-off?
Lo rende esplicito — e già non è poco. Il 1° luglio 2025 Cloudflare ha annunciato pay-per-crawl: un modello in cui ogni richiesta di un crawler IA riceve o il contenuto (HTTP 200, con intenzione di pagamento dichiarata), o una risposta HTTP 402 Payment Required con il prezzo. Tre opzioni per ogni crawler: Allow (accesso gratuito), Charge (pagamento al prezzo fissato per il dominio), Block (rifiuto, senza opzione di pagamento). L'autenticazione dei crawler si basa su firme crittografiche per contrastare lo spoofing dello user-agent, e Cloudflare fa da merchant of record.
Lo stesso giorno, un'altra svolta, più strutturale: Cloudflare ora blocca i crawler IA di default per i suoi nuovi clienti. Il web è passato da un modello opt-out (tutto è crawlable salvo rifiuto) a un modello opt-in (niente è crawlable senza accordo).
Se il tuo sito è passato dietro Cloudflare dopo luglio 2025, forse stai bloccando i crawler IA senza averlo mai deciso. Un audit dell'AI Crawl Control e dei tuoi log si impone, prima di chiederti perché il tuo tasso di citazione ristagna.
Lato ricavi, siamo onesti: il prezzo unitario di un crawl è basso, e la monetizzazione diventa significativa solo a volumi di crawl molto alti — un profilo da grande media, non da SaaS. L'equazione completa, costo GEO incluso:
Bisogna bloccare tutti i crawler IA, o decidere crawler per crawler?
Crawler per crawler, senza eccezioni. «Bloccare l'IA» è una categoria che tecnicamente non esiste: un crawler di training, un crawler di search e un agente che agisce per conto di un utente non hanno né lo stesso ruolo, né lo stesso costo quando li chiudi fuori.
La sequenza operativa, così come la eseguiamo:
- 011 — InventariareLog del server + AI Crawl Control: quali crawler IA passano davvero, con quale frequenza, su quali pagine. Decidere senza questo inventario è decidere alla cieca.
- 022 — ClassificareOgni user-agent in una delle tre famiglie: training, retrieval, agente. La documentazione di ogni editore (OpenAI, Anthropic, Perplexity) precisa il ruolo di ciascun bot.
- 033 — Fissare una baseline di citazioniTasso di citazione per modello sul tuo cluster di query, PRIMA di toccare il robots.txt. Senza baseline, impossibile attribuire un crollo al blocco.
- 044 — Decidere, poi monitorareApplicare la policy crawler per crawler e seguire l'effetto sulle citazioni settimana dopo settimana — è esattamente il tipo di loop descritto nella nostra pagina Come funziona.
E una precisazione necessaria: llms.txt non restringe nessun crawler. È un file di navigazione, non un controllo d'accesso — abbiamo documentato il mito e la realtà di llms.txt in dettaglio. Il controllo reale vive nel robots.txt (direttiva volontaria) e a livello WAF/CDN (applicazione forzata).
Come arbitrare tra monetizzazione e visibilità GEO per il tuo business?
La griglia sta in una domanda: il tuo contenuto è il prodotto, o la distribuzione? Un media vende il suo contenuto — ogni crawl non compensato è una perdita secca, e Charge è una posizione razionale. Un SaaS B2B o un brand e-commerce vende altro: il contenuto è solo il veicolo che fa entrare il brand nelle risposte IA. Chiuderlo significa chiudersi da soli il canale di acquisizione — e con l'ascesa del commercio agentico via ChatGPT, bloccare ChatGPT-User equivale a rifiutare l'ingresso a un cliente che arriva con la carta di credito in mano.
Arbitrare tra monetizzazione e visibilità
Il caso Amazon non è nemmeno un «errore» in senso stretto: Amazon può permettersi di perdere citazioni ChatGPT, il suo brand genera domanda da solo. Tu, probabilmente, no. Ogni citazione persa è una raccomandazione trasferita a un concorrente — e il retrieval non ha alcuna memoria della tua vecchia posizione.
FAQ
Per approfondire
- llms.txt: mito vs realtà — cosa fa davvero il file (e cosa non fa).
- La frammentazione delle citazioni IA per piattaforma — perché Amazon crolla su ChatGPT ma tiene su AI Overviews.
- Il commercio agentico ChatGPT e il protocollo ACP — la posta in gioco dietro il blocco di ChatGPT-User.
La tua policy di crawl è una decisione GEO. Fissa la tua baseline di citazioni su ChatGPT, Claude, Grok e DeepSeek, poi pilota l'effetto di ogni modifica — Come funziona descrive il loop misura → azione, e i Prezzi partono senza vincoli.
