TACTIQUES LLM SEEDING5 juin 2026· 9 min de lecture

Bloquer les crawlers IA : l'erreur GEO qu'Amazon vient de payer en citations ChatGPT

Amazon a restreint près de 50 crawlers IA — et vu ses citations ChatGPT chuter au profit de Walmart. Field-note sur le trade-off pay-per-crawl : monétiser le crawl ou rester cité, et comment décider crawler par crawler.

T
Tomáš Havel
Lead Researcher · GEO methodology
Bloquer les crawlers IA : l'erreur GEO qu'Amazon vient de payer en citations ChatGPT

Amazon a verrouillé son robots.txt contre les crawlers d'OpenAI ; quelques semaines plus tard, sa part de citations ChatGPT s'effondrait et Walmart prenait la place. Bloquer les crawlers IA protège le contenu — mais le prix se paie en visibilité LLM, là où vos acheteurs posent désormais leurs questions. Field-note sur l'arbitrage monétisation vs citations, et la seule façon saine de le trancher : crawler par crawler, jamais « l'IA » en bloc.

TL;DR
  • Amazon a restreint près de 50 user-agents IA dans son robots.txt (dont les trois crawlers OpenAI) → sa part de citations ChatGPT a chuté ; Walmart, resté ouvert, l'a dépassée.
  • Bloquer un crawler de retrieval = sortir des réponses, pas seulement du training des futurs modèles.
  • Pay-per-crawl (Cloudflare, juillet 2025) : Allow / Charge / Block par crawler, réponse HTTP 402 — et blocage des crawlers IA par défaut pour les nouveaux clients.
  • La bonne maille de décision : le crawler, pas « l'IA » — training, retrieval et agents n'ont pas le même coût GEO.
  • Règle d'arbitrage : si le contenu est votre produit → Charge ou Block ; si le contenu est votre distribution → Allow.

Que s'est-il passé entre Amazon et Walmart dans ChatGPT ?

Le résumé tient en une phrase : Amazon a fermé la porte aux crawlers d'OpenAI, et ChatGPT s'est mis à recommander Walmart. En octobre 2025, Amazon dominait les citations ChatGPT parmi les grands retailers. Entre fin 2025 et janvier 2026, son robots.txt s'est durci — ChatGPT-User, OAI-SearchBot, puis des dizaines d'autres bots — jusqu'à restreindre près de 50 user-agents IA, dont les trois crawlers d'OpenAI. Dès novembre, sa part de citations ChatGPT chutait nettement. Walmart, resté ouvert et signataire d'un partenariat Instant Checkout avec OpenAI, a comblé le vide et pris la tête sur ChatGPT.

LE CAS AMAZON, EN CHIFFRES
~50
user-agents IA restreints dans le robots.txt d'Amazon (janv. 2026)
3/3
crawlers OpenAI bloqués : GPTBot, ChatGPT-User, OAI-SearchBot
~50 M
requêtes shopping par jour via les agents ChatGPT, selon OpenAI
1 mois
entre le pic de citations d'Amazon (oct. 2025) et la chute (nov. 2025)

Sources : robots.txt d'Amazon (Modern Retail, Search Engine Land), données de citations ChatGPT Q1 2026, working paper de l'équipe Economic Research d'OpenAI.

Détail qui compte : sur Google AI Overviews, Amazon garde une avance confortable. Le blocage n'a coûté que là où il s'applique — chaque plateforme construit ses citations différemment, et c'est exactement pourquoi on suit la fragmentation des citations IA par plateforme comme un sujet à part entière.

Pourquoi bloquer les crawlers IA fait-il chuter les citations LLM ?

Parce qu'une réponse de ChatGPT ou Perplexity n'est pas générée depuis la seule mémoire du modèle : sur les requêtes commerciales, le modèle déclenche un retrieval en temps réel, lit les sources accessibles, puis cite ce qu'il a pu lire. Bloquer le crawler de retrieval, c'est se retirer soi-même de la liste des sources candidates au moment de la requête. Le modèle ne « punit » personne — il cite simplement qui reste lisible.

Walmart n'est pas devenu meilleur en novembre 2025. Il est juste resté accessible pendant qu'Amazon devenait illisible. Le signal de demande que vous construisez ne sert à rien si, au moment du retrieval, le crawler se heurte à un 403.

Amazon a protégé son catalogue ; Walmart a pris ses citations. Le robots.txt n'est plus une ligne d'hygiène technique — c'est une décision de distribution.

C'est ce qu'on mesure chez Rankfeed : le taux de citation par modèle est le révélateur immédiat de ce genre de décision d'infrastructure.

Le pay-per-crawl de Cloudflare change-t-il l'arbitrage ?

Il le rend explicite — et c'est déjà beaucoup. Le 1er juillet 2025, Cloudflare a annoncé pay-per-crawl : un modèle où chaque requête d'un crawler IA reçoit soit le contenu (HTTP 200, avec intention de paiement déclarée), soit une réponse HTTP 402 Payment Required avec le prix. Trois options par crawler : Allow (accès gratuit), Charge (paiement au prix fixé pour le domaine), Block (refus, sans option de paiement). L'authentification des crawlers repose sur des signatures cryptographiques pour contrer le spoofing de user-agent, et Cloudflare joue le merchant of record.

Le même jour, autre bascule, plus structurelle : Cloudflare bloque désormais les crawlers IA par défaut pour ses nouveaux clients. Le web est passé d'un modèle opt-out (tout est crawlable sauf refus) à un modèle opt-in (rien n'est crawlable sans accord).

!
Vérifiez votre propre config

Si votre site est passé derrière Cloudflare après juillet 2025, vous bloquez peut-être les crawlers IA sans l'avoir jamais décidé. Un audit de l'AI Crawl Control et de vos logs s'impose avant de chercher pourquoi votre taux de citation stagne.

Côté revenus, restons honnêtes : le prix unitaire d'un crawl est faible, et la monétisation ne devient significative qu'à très gros volume — un profil de grand média, pas de SaaS. L'équation complète, coût GEO inclus :

OPTION PAY-PER-CRAWLEFFET IMMÉDIATCOÛT GEO
AllowAccès gratuit pour le crawlerAucun — vous restez dans le retrieval
ChargeHTTP 402 + prix par requêteVariable — les crawlers qui refusent de payer vous sortent de leurs sources
BlockAccès refusé, sans option de paiementMaximal — sortie progressive des réponses IA, au profit des concurrents ouverts

Faut-il bloquer tous les crawlers IA, ou décider crawler par crawler ?

Crawler par crawler, sans exception. « Bloquer l'IA » est une catégorie qui n'existe pas techniquement : un crawler de training, un crawler de search et un agent qui agit pour un utilisateur n'ont ni le même rôle, ni le même coût quand on les ferme.

TYPE DE CRAWLEREXEMPLESDÉCISION PAR DÉFAUT
TrainingGPTBot, ClaudeBotNégociable — Charge ou Block si le contenu est votre actif principal
Search / retrievalOAI-SearchBot, PerplexityBotAllow — c'est lui qui produit les citations
Agent / action utilisateurChatGPT-UserAllow si vous vendez quelque chose ; le bloquer ferme le canal agentique

La séquence opérationnelle, telle qu'on la déroule :

  1. 01
    1 — Inventorier
    Logs serveur + AI Crawl Control : quels crawlers IA passent réellement, à quelle fréquence, sur quelles pages. Décider sans cet inventaire, c'est décider à l'aveugle.
  2. 02
    2 — Classer
    Chaque user-agent dans une des trois familles : training, retrieval, agent. La doc de chaque éditeur (OpenAI, Anthropic, Perplexity) précise le rôle de chaque bot.
  3. 03
    3 — Poser une baseline de citations
    Taux de citation par modèle sur votre cluster de requêtes, AVANT de toucher au robots.txt. Sans baseline, impossible d'attribuer une chute au blocage.
  4. 04
    4 — Décider, puis monitorer
    Appliquer la politique crawler par crawler et suivre l'effet sur les citations semaine après semaine — c'est exactement le type de boucle que décrit notre page Comment ça marche.

Et une mise au point nécessaire : llms.txt ne restreint aucun crawler. C'est un fichier de navigation, pas un contrôle d'accès — on a documenté le mythe et la réalité de llms.txt en détail. Le contrôle réel vit dans robots.txt (directive volontaire) et au niveau WAF/CDN (application forcée).

Comment arbitrer monétisation vs visibilité GEO pour votre business ?

La grille tient en une question : votre contenu est-il le produit, ou la distribution ? Un média vend son contenu — chaque crawl non compensé est une perte sèche, et Charge est une position rationnelle. Un SaaS B2B ou une marque e-commerce vend autre chose : le contenu n'est que le véhicule qui fait entrer la marque dans les réponses IA. Le fermer, c'est fermer son propre canal d'acquisition — et avec l'essor du commerce agentique via ChatGPT, bloquer ChatGPT-User revient à refuser l'entrée à un client accompagné de sa carte bancaire.

Arbitrer monétisation vs visibilité

À FAIRE
Décider crawler par crawler, famille par famille. Laisser passer les crawlers de retrieval qui produisent les citations. Poser une baseline de taux de citation avant tout changement de robots.txt. Réserver Charge/Block aux crawlers de training, et seulement si le contenu est l'actif. Re-vérifier la config Cloudflare héritée du default-block.
À ÉVITER
Bloquer « tous les bots IA » en un clic. Confondre crawler de training et crawler de retrieval. Croire que llms.txt bloque quoi que ce soit. Sacrifier des citations LLM pour un micro-revenu de crawl quand le contenu n'est pas le produit. Découvrir la chute de citations trois mois plus tard, sans baseline pour la prouver.

Le cas Amazon n'est même pas une « erreur » stricte : Amazon peut se permettre de perdre des citations ChatGPT, sa marque génère sa propre demande. Vous, probablement pas. Chaque citation perdue est une recommandation transférée à un concurrent — et le retrieval n'a aucune mémoire de votre ancienne position.

FAQ

Non, et c'est la nuance clé. GPTBot alimente le training des futurs modèles : le bloquer n'affecte pas les réponses d'aujourd'hui. Ce sont OAI-SearchBot et ChatGPT-User qui alimentent le retrieval en temps réel — les bloquer fait sortir le site des citations et du shopping ChatGPT, comme l'a montré le cas Amazon.

Pour aller plus loin

MESUREZ AVANT DE BLOQUER

Votre politique de crawl est une décision GEO. Posez votre baseline de citations sur ChatGPT, Claude, Grok et DeepSeek, puis pilotez l'effet de chaque changement — Comment ça marche détaille la boucle mesure → action, et les Tarifs démarrent sans engagement.

T
Tomáš Havel
LEAD RESEARCHER · GEO METHODOLOGY

Faites apparaître votre marque dans ChatGPT, Claude, Grok et DeepSeek.

Rankfeed nourrit les 4 modèles avec votre cluster sémantique. Warm-up 14 jours, feed continu, dès 79 €/mois.

Démarrer mon feed →
DIGEST GEO HEBDOMADAIRE

Recevez le prochain guide GEO

Un email tous les dimanches. Tactiques LLM Seeding, chiffres du marché IA, zéro marketing.