Autorisation des robots d'indexation OpenAI dans Ads Manager

Idée centrale

OpenAI utilise des robots d'indexation (crawlers) pour valider les pages de destination soumises comme annonces dans ChatGPT : sans accès crawlable, une annonce ne peut ni être validée à la revue, ni rester en diffusion. Deux crawlers distincts sont concernés — OAI-AdsBot (requis) et OAI-SearchBot (recommandé) — et l'accès à une page peut être bloqué indépendamment par trois couches de protection technique (robots.txt, protection web/anti-bot, vérification humaine), qu'il faut diagnostiquer successivement.

Cette description reprend le contenu du guide « Advertiser Guidance for Allowing OpenAI Web Crawlers » du centre d'aide OpenAI.

Définition

La procédure et le diagnostic permettant à une page de destination publicitaire d'être accessible aux robots d'indexation d'OpenAI — un prérequis technique déjà catalogué dans Ads Manager et exigé explicitement par le schéma d'import en masse documenté dans Lancement d'une campagne dans Ads Manager (URL de destination « non bloquée pour les robots d'indexation d'OpenAI »).

Synthèse éditoriale : reformulation condensée du guide OpenAI cité ci-dessus.

Contexte

S'applique à toute page de destination soumise dans une annonce ChatGPT Ads, que la campagne soit créée par le flux guidé ou par import en masse (voir Lancement d'une campagne dans Ads Manager). Documenté pour la Beta, au moment de la capture (2026-08-08).

Fonctionnement

Pourquoi OpenAI crawle les pages de destination

Quand un annonceur soumet une annonce, OpenAI peut visiter la page de destination pour vérifier sa conformité à la politique publicitaire d'OpenAI (Ad Policies) : celle-ci impose notamment l'« intégrité de la destination » (la page de destination doit correspondre à l'offre annoncée) parmi les exigences pesant sur les annonceurs, et prévoit une revue de la conformité du créatif et de la page de destination au moment de l'upload — la deuxième des trois étapes de son processus de revue. Le contenu de la page peut aussi servir à déterminer le moment le plus pertinent pour afficher l'annonce aux utilisateurs.

Crawlers à autoriser

Trois couches de blocage à diagnostiquer successivement

Un diagnostic incomplet (par exemple, corriger uniquement la première couche) peut laisser une page inaccessible sans que la cause en soit évidente. Les trois couches sont indépendantes :

  1. robots.txt — les crawlers d'OpenAI respectent ce fichier ; un refus y arrête immédiatement le crawl. Exemple de configuration donné par la source :
   User-agent: OAI-SearchBot
   Allow: /
   User-agent: OAI-AdsBot
   Allow: /
  1. Protection web et mitigation de bots (Cloudflare, Akamai, ou autres fournisseurs de protection contre le scraping et le trafic non autorisé) — ces services peuvent bloquer par erreur des crawlers légitimes, renvoyant souvent une erreur 403 Forbidden, s'ils ne sont pas explicitement mis sur liste blanche. Recommandation : passer en revue la configuration du pare-feu ou de la protection web et y autoriser le trafic des crawlers OpenAI, idéalement par user agent ; inspecter aussi les règles automatisées de mitigation de bots susceptibles de déclencher de faux positifs.
  2. Vérification humaine et logique anti-bot (CAPTCHA, défis JavaScript, analyse comportementale, validation de session) — ces contrôles applicatifs peuvent bloquer l'accès même après correction des deux couches précédentes, car les crawlers d'OpenAI sont des systèmes automatisés ; il faut en exempter les crawlers OpenAI, idéalement par user agent.

Plages d'IP stables

Certains systèmes de sécurité exigent que le trafic provienne de plages d'IP stables et publiquement documentées avant une mise sur liste blanche fiable. L'infrastructure des crawlers pouvant évoluer dans le temps, il est déconseillé de se fier uniquement à de simples observations d'IP à court terme tirées des journaux. La source recommande de combiner identification par user agent, programmes de vérification de bots quand ils sont pris en charge, listes blanches de pare-feu, respect de robots.txt et systèmes de vérification de bots au niveau du fournisseur. Pour une liste stable de plages d'IP, la source renvoie vers openai.com/searchbot.json et openai.com/adsbot.json (contenu non capturé).

Limitation de débit (rate limiting)

Des lots d'import en masse volumineux ou des pics soudains de trafic crawler peuvent parfois déclencher une limitation de débit automatisée ou des systèmes de protection anti-bot. En cas de suspicion, la source recommande d'examiner les codes de réponse HTTP (en particulier 429 Too Many Requests), les journaux de pare-feu ou de CDN, les événements de mitigation de bots, les règles de limitation de requêtes, et les analyses de trafic autour du moment où le crawler a tenté d'accéder au site. Recommandation pratique : envisager d'étaler les téléversements sur une période plus longue, en lots plus petits — une recommandation identique à celle déjà documentée dans Lancement d'une campagne dans Ads Manager pour les imports en masse volumineux, ici attribuée spécifiquement à un risque d'infrastructure côté annonceur (pare-feu, CDN, mitigation de bots) plutôt qu'à une erreur de formatage du fichier.

Éléments essentiels

FAQ crawlers et pages de destination, telle que formulée par la source :

Distinctions importantes

Ce contenu explique le mécanisme derrière une exigence déjà documentée ailleurs dans le wiki sans être détaillée jusqu'ici : l'URL de destination du schéma CSV d'import en masse doit être « non bloquée pour les robots d'indexation d'OpenAI » (Lancement d'une campagne dans Ads Manager), et les pages de destination « ne doivent pas bloquer les user agents OpenAI » (Bonnes pratiques de création des annonces dans ChatGPT). Les trois couches de blocage documentées ici (robots.txt, protection web, vérification humaine) sont indépendantes les unes des autres — corriger l'une ne garantit pas que les autres soient déjà correctement configurées.

Cas pratiques

Aucun cas pratique disponible : aucune capture d'écran de configuration robots.txt ou de règle de pare-feu réelle, aucun exemple de diagnostic mené jusqu'au bout.

Erreurs fréquentes

Limites et nuances

Relations

Points à vérifier

Sources