À compléter avant l'envoi
[site URL][Search Console property, or "none"][5 to 10 page URLs]
Vérifie si mon site [site URL] peut servir du contenu aux moteurs de recherche IA tels que ChatGPT, Claude, Perplexity, Gemini et Copilot. Ma propriété Search Console est [Search Console property, or "none"]. Mes pages les plus importantes sont : [5 to 10 page URLs]. Il s'agit d'un audit en lecture seule, ne modifie rien.
1. robots.txt. Lis [site URL]/robots.txt avec site_read_url et note le code de statut. Si le fichier renvoie une erreur 5xx ou boucle sur des redirections, indique-le tout en haut : les robots risquent de ne pas explorer le site du tout. Détermine ensuite quel groupe de règles s'applique à chacun de ces robots et si mes pages clés sont autorisées : OAI-SearchBot, ChatGPT-User, GPTBot, Claude-SearchBot, Claude-User, ClaudeBot, PerplexityBot, Perplexity-User, Googlebot, Google-Extended, Bingbot, Applebot, Applebot-Extended, CCBot, meta-externalagent. Lorsqu'un robot dispose d'un groupe à son propre nom, seul ce groupe s'applique et les règles de `User-agent: *` ne s'appliquent pas : tiens-en compte.
2. Classe les robots selon leur rôle. Ceux qui explorent pour la recherche et les citations sont OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot et Googlebot. Ceux qui récupèrent une page en direct lorsqu'un utilisateur pose une question sont ChatGPT-User, Claude-User et Perplexity-User. Ceux qui collectent des données d'entrainement sont GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot et meta-externalagent. Signale tout robot de recherche bloqué avec le niveau de gravité le plus élevé, car le site ne peut alors pas être cité dans les réponses de cet assistant. Ne considère pas le blocage d'un robot d'entrainement comme une erreur, décris-le comme un choix. Précise que Google-Extended n'a aucun effet sur Google Search ni sur les AI Overviews et ne contrôle que l'utilisation du contenu pour les modèles Gemini.
3. Codes de statut et en-têtes. Lis chaque page clé avec site_read_url et max_bytes=0. Indique uniquement le code de statut, la chaine de redirections (redirects), les en-têtes `x-robots-tag` et `content-type` ainsi que la valeur de `server`, sans reproduire tous les en-têtes. Signale les chaines de redirections de plus de deux étapes, une URL finale différente de l'URL canonique, ainsi que tout en-tête noindex ou nosnippet. Si une page renvoie 403, 429 ou 503 et que la valeur de server révèle une couche de protection comme Cloudflare, Sucuri ou Akamai, indique qu'il peut s'agir d'un blocage de robots.
4. Contenu sans JavaScript. Lis les pages clés avec site_read_url et text=true. Cette vue est extraite du HTML envoyé par le serveur, c'est-à-dire ce que voit un robot d'IA qui n'exécute pas JavaScript. Si la réponse indique truncated à true, relis la page avec max_bytes=1000000, sinon tu croiras que le contenu situé en bas de page est absent. Pour chaque page, indique si le H1, le premier paragraphe du contenu principal, les informations de prix ou de service et les coordonnées figurent dans ce texte, et si internal_links contient des liens vers les pages du menu principal.
5. Contenu avec JavaScript. Mesure les trois pages les plus importantes avec seo_technical_audit, qui affiche la page en exécutant JavaScript. Signale séparément toute page dont le titre, le H1 ou la langue diffère entre les deux vues. Une différence de langue provient généralement d'une redirection automatique selon le pays ou la langue du navigateur du visiteur, et comme la plupart des robots d'IA viennent de serveurs situés aux États-Unis, cela peut leur faire voir la mauvaise version linguistique.
6. Ce que voit Google. Si j'ai une propriété Search Console, inspecte les pages clés en un seul appel gsc_inspect_urls : état de couverture, date de dernière exploration et URL canonique choisie par Google. Liste toute page clé bloquée par le robots.txt ou affichée comme « Explorée, actuellement non indexée ». Liste les sitemaps soumis avec leurs avertissements et erreurs à l'aide de gsc_sitemaps.
7. Fichiers de découverte. Lis sitemap.xml et llms.txt avec site_read_url. Vérifie que mes pages clés figurent dans le sitemap et que les valeurs lastmod paraissent réelles, et signale-le si toutes les URL portent la même date. Si llms.txt est absent, note-le comme une lacune mais pas comme un problème critique, car aucun des principaux moteurs de recherche IA n'a officiellement indiqué utiliser ce fichier comme signal de classement ou de citation.
Énonce clairement les limites des outils. site_read_url envoie sa requête comme un navigateur et ne peut pas se faire passer pour GPTBot ou ClaudeBot : une règle de pare-feu qui bloque uniquement d'après le nom du robot n'apparaitra donc pas dans cet audit. Si j'utilise un CDN ou un pare-feu, rappelle-moi de vérifier dans son interface un paramètre qui bloque les robots d'IA (chez Cloudflare, « AI Crawl Control » ou « Block AI bots »). Si le site est hébergé sur Opus Growth, ne m'envoie vers aucune interface de CDN, et si tu constates un blocage, suggère de le signaler avec report_issue.
Présente le résultat ainsi. D'abord un résumé en trois phrases : mon site est-il ouvert à la recherche IA et, sinon, quel est le principal point de blocage. Ensuite un tableau des robots : robot, rôle, décision du robots.txt, ligne de règle qui tranche, gravité. Puis un tableau des pages : URL, code de statut, redirections, x-robots-tag, H1 et premier paragraphe présents dans le texte sans JavaScript (oui ou non), écart avec la vue JavaScript, état de couverture Google. Termine par une liste de correctifs classés par gravité, chacun accompagné de sa preuve et de la personne qui doit s'en charger (moi, un développeur, l'hébergeur). Lorsque les données ne suffisent pas pour conclure, ne devine pas : indique ce qui manque.