Autorisation des robots d'indexation OpenAI dans Ads Manager
Idée centrale
OpenAI utilise des robots d'indexation (crawlers) pour valider les pages de destination soumises comme annonces dans ChatGPT : sans accès crawlable, une annonce ne peut ni être validée à la revue, ni rester en diffusion. Deux crawlers distincts sont concernés — OAI-AdsBot (requis) et OAI-SearchBot (recommandé) — et l'accès à une page peut être bloqué indépendamment par trois couches de protection technique (robots.txt, protection web/anti-bot, vérification humaine), qu'il faut diagnostiquer successivement.
Cette description reprend le contenu du guide « Advertiser Guidance for Allowing OpenAI Web Crawlers » du centre d'aide OpenAI.
Définition
La procédure et le diagnostic permettant à une page de destination publicitaire d'être accessible aux robots d'indexation d'OpenAI — un prérequis technique déjà catalogué dans Ads Manager et exigé explicitement par le schéma d'import en masse documenté dans Lancement d'une campagne dans Ads Manager (URL de destination « non bloquée pour les robots d'indexation d'OpenAI »).
Synthèse éditoriale : reformulation condensée du guide OpenAI cité ci-dessus.
Contexte
S'applique à toute page de destination soumise dans une annonce ChatGPT Ads, que la campagne soit créée par le flux guidé ou par import en masse (voir Lancement d'une campagne dans Ads Manager). Documenté pour la Beta, au moment de la capture (2026-08-08).
Fonctionnement
Pourquoi OpenAI crawle les pages de destination
Quand un annonceur soumet une annonce, OpenAI peut visiter la page de destination pour vérifier sa conformité à la politique publicitaire d'OpenAI (Ad Policies) : celle-ci impose notamment l'« intégrité de la destination » (la page de destination doit correspondre à l'offre annoncée) parmi les exigences pesant sur les annonceurs, et prévoit une revue de la conformité du créatif et de la page de destination au moment de l'upload — la deuxième des trois étapes de son processus de revue. Le contenu de la page peut aussi servir à déterminer le moment le plus pertinent pour afficher l'annonce aux utilisateurs.
Crawlers à autoriser
- OAI-AdsBot : requis pour la validation et la revue des pages de destination des annonces ChatGPT.
- OAI-SearchBot : recommandé en complément — il peut aider OpenAI à comprendre le contenu public du web — mais n'est pas prioritaire pour la préparation des annonces.
- OAI-AdsBot est officiellement vérifié et mis sur liste blanche par Cloudflare.
Trois couches de blocage à diagnostiquer successivement
Un diagnostic incomplet (par exemple, corriger uniquement la première couche) peut laisser une page inaccessible sans que la cause en soit évidente. Les trois couches sont indépendantes :
- robots.txt — les crawlers d'OpenAI respectent ce fichier ; un refus y arrête immédiatement le crawl. Exemple de configuration donné par la source :
User-agent: OAI-SearchBot
Allow: /
User-agent: OAI-AdsBot
Allow: /
- Protection web et mitigation de bots (Cloudflare, Akamai, ou autres fournisseurs de protection contre le scraping et le trafic non autorisé) — ces services peuvent bloquer par erreur des crawlers légitimes, renvoyant souvent une erreur 403 Forbidden, s'ils ne sont pas explicitement mis sur liste blanche. Recommandation : passer en revue la configuration du pare-feu ou de la protection web et y autoriser le trafic des crawlers OpenAI, idéalement par user agent ; inspecter aussi les règles automatisées de mitigation de bots susceptibles de déclencher de faux positifs.
- Vérification humaine et logique anti-bot (CAPTCHA, défis JavaScript, analyse comportementale, validation de session) — ces contrôles applicatifs peuvent bloquer l'accès même après correction des deux couches précédentes, car les crawlers d'OpenAI sont des systèmes automatisés ; il faut en exempter les crawlers OpenAI, idéalement par user agent.
Plages d'IP stables
Certains systèmes de sécurité exigent que le trafic provienne de plages d'IP stables et publiquement documentées avant une mise sur liste blanche fiable. L'infrastructure des crawlers pouvant évoluer dans le temps, il est déconseillé de se fier uniquement à de simples observations d'IP à court terme tirées des journaux. La source recommande de combiner identification par user agent, programmes de vérification de bots quand ils sont pris en charge, listes blanches de pare-feu, respect de robots.txt et systèmes de vérification de bots au niveau du fournisseur. Pour une liste stable de plages d'IP, la source renvoie vers openai.com/searchbot.json et openai.com/adsbot.json (contenu non capturé).
Limitation de débit (rate limiting)
Des lots d'import en masse volumineux ou des pics soudains de trafic crawler peuvent parfois déclencher une limitation de débit automatisée ou des systèmes de protection anti-bot. En cas de suspicion, la source recommande d'examiner les codes de réponse HTTP (en particulier 429 Too Many Requests), les journaux de pare-feu ou de CDN, les événements de mitigation de bots, les règles de limitation de requêtes, et les analyses de trafic autour du moment où le crawler a tenté d'accéder au site. Recommandation pratique : envisager d'étaler les téléversements sur une période plus longue, en lots plus petits — une recommandation identique à celle déjà documentée dans Lancement d'une campagne dans Ads Manager pour les imports en masse volumineux, ici attribuée spécifiquement à un risque d'infrastructure côté annonceur (pare-feu, CDN, mitigation de bots) plutôt qu'à une erreur de formatage du fichier.
Éléments essentiels
FAQ crawlers et pages de destination, telle que formulée par la source :
- Le support peut-il contourner manuellement la validation par crawler ? Non — il ne faut pas se reposer sur un contournement manuel. Il faut rendre la page de destination effectivement crawlable pour OAI-AdsBot en corrigeant les blocages liés à robots.txt, au WAF, au CDN, à la mitigation de bots, à l'authentification et à la limitation de débit, puis reteléverser ou resoumettre les annonces concernées.
- Que doit vérifier en premier l'équipe d'ingénierie ? Si la page de destination renvoie une réponse HTTP réussie à OAI-AdsBot, si robots.txt autorise le chemin concerné, et si un WAF, un CDN, une mitigation de bots, des défis JavaScript, des CAPTCHA, une authentification ou des règles géographiques bloquent l'accès automatisé.
- Les liens d'app store, les liens profonds (deep links) ou les destinations non web sont-ils pris en charge comme pages de destination ? À utiliser autant que possible une page web directement accessible : les liens d'app store, liens profonds, documents, ou destinations nécessitant une application, une connexion, un accès restreint à une région, ou des redirections non prises en charge, peuvent ne pas fournir assez de contenu crawlable pour la validation ou la revue.
- Quand faut-il reteléverser ou redemander une revue ? Après avoir corrigé l'accès des crawlers, si le statut ne se met pas à jour automatiquement. Pour les annonces téléversées en masse, des lots plus petits peuvent réduire les déclenchements de limitation de débit ou de protection anti-bot pendant que l'équipe valide la correction.
Distinctions importantes
Ce contenu explique le mécanisme derrière une exigence déjà documentée ailleurs dans le wiki sans être détaillée jusqu'ici : l'URL de destination du schéma CSV d'import en masse doit être « non bloquée pour les robots d'indexation d'OpenAI » (Lancement d'une campagne dans Ads Manager), et les pages de destination « ne doivent pas bloquer les user agents OpenAI » (Bonnes pratiques de création des annonces dans ChatGPT). Les trois couches de blocage documentées ici (robots.txt, protection web, vérification humaine) sont indépendantes les unes des autres — corriger l'une ne garantit pas que les autres soient déjà correctement configurées.
Cas pratiques
Aucun cas pratique disponible : aucune capture d'écran de configuration robots.txt ou de règle de pare-feu réelle, aucun exemple de diagnostic mené jusqu'au bout.
Erreurs fréquentes
- Ne pas se limiter à la correction d'une seule couche de blocage (par exemple robots.txt seul) en pensant que cela suffit : les trois couches sont indépendantes.
- Ne pas se fier à de simples observations d'IP dans les journaux pour mettre en liste blanche le trafic des crawlers OpenAI : privilégier l'identification par user agent et les ressources officielles.
- Ne pas attendre un contournement manuel du support en cas de blocage : la page de destination doit être rendue effectivement crawlable avant toute nouvelle revue.
- Ne pas utiliser de lien d'app store, de lien profond ou de destination nécessitant une connexion comme page de destination principale : le contenu risque de ne pas être suffisamment crawlable.
Limites et nuances
- Source unique OpenAI, aucune corroboration indépendante des recommandations techniques (couches de blocage, comportement de Cloudflare, seuils de limitation de débit).
- Aucune capture d'écran ni exemple concret de configuration robots.txt ou de règle de pare-feu réelle.
- Le contenu externe référencé (documentation des robots d'indexation, fichiers JSON de plages d'IP) n'est pas capturé : seules l'existence et l'URL de ces ressources sont connues.
- Aucune adresse de support dédiée aux problèmes de crawl n'est indiquée par cette source, à la différence de l'adresse
ads-support@openai.comdéjà documentée pour les erreurs d'import en masse dans Lancement d'une campagne dans Ads Manager — il n'est pas confirmé qu'il s'agisse de la même adresse pour les problèmes de crawl.
Relations
- Ads Manager — catalogue ce prérequis technique en une ligne ; cette page en détaille le mécanisme.
- Lancement d'une campagne dans Ads Manager — exige une URL de destination non bloquée pour les robots d'indexation dans le schéma CSV d'import en masse, et documente la limitation de débit lors des imports.
- Bonnes pratiques de création des annonces dans ChatGPT — recommande de ne pas bloquer les user agents OpenAI sur la page de destination.
- Dépannage des problèmes courants dans Ads Manager — une annonce rejetée ou au statut « Not serving » peut avoir pour cause un blocage de crawler sur la page de destination.
- Ad Policies — prérequis technique distinct de cette page, mais nécessaire à la revue de conformité de la page de destination qu'exige cette politique.
Points à vérifier
- Contenu de la documentation des robots d'indexation d'OpenAI (
developers.openai.com/api/docs/bots). - Contenu des fichiers de plages d'IP (
openai.com/searchbot.json,openai.com/adsbot.json). - Existence et éventuelle distinction d'une adresse de support dédiée aux problèmes de crawl, par rapport à
ads-support@openai.com.
Sources
SRC-2026-022— « Advertiser Guidance for Allowing OpenAI Web Crawlers »,help.openai.com/en/articles/20001243-advertiser-guidance-for-allowing-openai-web-crawlers, capturée le 2026-08-08. Fiche complète :01_SOURCES/SRC-2026-022 - Advertiser Guidance for Allowing OpenAI Web Crawlers.md.SRC-2026-029— « Ad Policies », openai.com/policies/ad-policies/, version 1.3 publiée le 2026-07-15, capturée le 2026-08-08. Fiche complète :01_SOURCES/SRC-2026-029 - Ad Policies.md.