AEO

Comment vérifier si les moteurs de réponse IA peuvent lire votre page

Six contrôles vous disent si un moteur de réponse IA peut vraiment lire une page : accès des robots, code de statut, indexabilité, contenu dans le HTML brut, contrôles d'extraits et structure. Vous pouvez tous les faire sans outil payant.

Réponse courte : vérifiez six points dans cet ordre : que le robots.txt autorise le robot du moteur de réponse, que la page renvoie un statut 200, que rien ne la marque en noindex, que le contenu principal figure dans le HTML brut sans JavaScript, que les contrôles d'extraits n'empêchent pas la citation et que la page a des titres clairs et une réponse directe. Si les six passent, la page est lisible. Qu'elle soit citée est une autre question.

Pourquoi "lisible" ne veut-il pas dire "visible dans un navigateur" ?

Un navigateur exécute le JavaScript, charge les polices, attend les scripts et vous montre la page terminée. Beaucoup de robots en font bien moins. Des tests publiés fin 2024 ont montré que les principaux robots d'IA récupéraient le HTML brut sans exécuter de JavaScript. Une page parfaite dans Chrome peut être presque vide pour eux.

Nous avons constaté une version plus subtile de ce problème sur notre propre site. Notre framework diffusait en streaming le titre de la page et la balise canonique dans le corps du HTML pour la plupart des visiteurs, et ne les envoyait dans le <head> qu'à une liste de bots autorisés qui ne comprenait aucun robot d'IA. Lors d'une mesure le 22 septembre 2026, GPTBot recevait la balise <title> à l'octet 29 701 de la page, après le titre principal. Bingbot la recevait à l'octet 1 533. Pour n'importe quel humain, la page semblait correcte. Nous l'avons corrigé en élargissant la liste de bots autorisés, et le titre arrive désormais à l'octet 1 985 pour les robots d'IA aussi.

La leçon : vérifiez toujours ce que reçoit le robot, pas ce que vous voyez.

Quels sont les six contrôles ?

1. Accès des robots

Ouvrez yourdomain.com/robots.txt et vérifiez les groupes d'OAI-SearchBot (recherche de ChatGPT), PerplexityBot, Claude-SearchBot et Googlebot. Un Disallow: / sous User-agent: * bloque tous les robots qui n'ont pas leur propre groupe. Notre outil gratuit lit le fichier pour vous et liste les robots d'IA autorisés ; la liste des robots explique ce que fait chacun.

2. Code de statut

La page doit renvoyer 200. Les chaînes de redirections, les soft 404 et les pages qui renvoient 200 tout en affichant un message d'erreur embrouillent les robots. Vous pouvez vérifier avec curl -I https://yourdomain.com/page.

3. Indexabilité

Cherchez <meta name="robots" content="noindex"> dans le HTML et un en-tête de réponse X-Robots-Tag: noindex. Vérifiez que la balise canonique pointe vers la page elle-même, pas vers la page d'accueil ni vers une autre URL. Une canonique erronée dit aux moteurs d'ignorer la page au profit d'une autre.

4. Contenu dans le HTML brut

Récupérez la page sans JavaScript et cherchez votre texte principal :

curl -s -A "Mozilla/5.0 (compatible; GPTBot/1.2)" https://yourdomain.com/page | less

Si le titre, le premier paragraphe et les faits clés manquent dans cette sortie, les robots d'IA ne peuvent probablement pas les lire. La solution : le rendu côté serveur ou la génération statique pour le contenu important.

5. Contrôles d'extraits

nosnippet, max-snippet:0 et data-nosnippet demandent aux moteurs de ne pas citer le texte. Google les applique aussi aux fonctionnalités d'IA de la recherche. Utilisez-les délibérément sur le texte que vous ne voulez pas voir cité, pas par accident sur tout un modèle de page.

6. Structure et réponse directe

Lisible ne veut pas dire utile. Vérifiez que la page a un seul H1 clair, des intertitres descriptifs et un premier paragraphe qui répond à la question principale de la page. Les moteurs reprennent des passages autonomes ; une page qui n'en vient au fait qu'au huitième paragraphe leur donne peu à citer.

Existe-t-il un moyen plus rapide de faire les six ?

Oui. Notre contrôle gratuit d'une page récupère une URL une fois et lui applique les 88 contrôles au niveau de la page de notre registre des contrôles : structure, schema, aptitude à répondre et citabilité. Chaque constat montre la preuve, pour que vous puissiez le vérifier vous-même. Aucun compte n'est nécessaire.

Pour Google en particulier, l'outil d'inspection d'URL de Search Console montre le HTML rendu par Google et si la page est indexée.

Quel est l'équivalent en SEO classique ?

Les six contrôles relèvent du SEO technique standard : robots.txt, codes de statut, directives d'indexation, rendu et structure on-page. La différence avec la recherche IA, c'est que vous devez désormais satisfaire plusieurs robots, dont certains font moins de rendu que Googlebot : le contenu rendu côté serveur compte donc davantage.

Questions fréquentes

Les robots d'IA exécutent-ils le JavaScript ?

Beaucoup, non. Partez du principe qu'un contenu qui n'apparaît qu'après l'exécution du JavaScript peut être invisible pour les robots d'IA, et rendez le contenu important côté serveur.

Ma page est indexée dans Google. ChatGPT peut-il la lire ?

Pas forcément. La recherche de ChatGPT utilise OAI-SearchBot et son propre index. Vérifiez qu'OAI-SearchBot est autorisé et que votre contenu figure dans le HTML brut.

Corriger ces points garantit-il des citations ?

Non. Ces contrôles rendent une page lisible. Être cité dépend aussi de la correspondance avec la question et de la présence d'un passage citable, ce que nous expliquons dans comment les moteurs IA choisissent les marques qu'ils citent.

Analyser votre site