GEO · Technique

Checklist technique du GEO en 2026 : ce qui compte vraiment pour être lu et cité par les IA

8 octobre 2026Mis à jour le 8 octobre 2026 9 min de lecture Jonathan Fauconnier GEO
Réponse directe

Pour être cité par ChatGPT, Gemini, Copilot ou les Aperçus IA de Google, un site doit d'abord être lisible par leurs robots : robots de recherche autorisés (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot, Bingbot), contenu présent dans le HTML sans dépendre de JavaScript, pages indexées dans Google et dans Bing, et aucune directive qui les exclut des réponses (noindex, nosnippet, NOARCHIVE). Le fichier llms.txt et les données structurées passent après : Google indique que sa recherche ignore llms.txt et qu'aucun balisage spécial n'est nécessaire pour ses fonctionnalités d'IA générative.

Situation au 8 octobre 2026. Cette checklist reprend les règles publiées par Google, Microsoft, OpenAI, Anthropic et Perplexity, et la façon dont nous les appliquons sur one-online.fr. Le mécanisme de choix des sources est expliqué dans comment les IA choisissent qui recommander.

1. Laisser passer les bons robots

Chaque éditeur sépare ses robots selon leur rôle : entraîner les modèles, indexer les pages pour la recherche, ou lire une page à la demande d'un utilisateur. Bloquer un robot d'entraînement n'empêche pas d'être cité ; bloquer un robot de recherche, si.

RobotÉditeurRôleSi vous le bloquez
OAI-SearchBotOpenAIFait apparaître les sites dans la recherche de ChatGPTVos pages ne sont plus montrées dans les réponses de recherche de ChatGPT, hors liens de navigation
GPTBotOpenAICollecte pour l'entraînement des modèlesVos contenus sortent de l'entraînement, sans effet sur la recherche de ChatGPT
ChatGPT-UserOpenAIPages ouvertes à la demande d'un utilisateurLes règles du robots.txt peuvent ne pas s'appliquer, l'action venant de l'utilisateur
Claude-SearchBotAnthropicIndexation pour la recherche de ClaudeVos pages ne sont plus indexées pour la recherche de Claude
Claude-UserAnthropicPages ouvertes à la demande d'un utilisateurClaude ne peut plus lire vos pages pour répondre à une question
ClaudeBotAnthropicCollecte pour l'entraînement des modèlesVos futurs contenus sortent de l'entraînement
PerplexityBotPerplexityIndexation pour les résultats de PerplexityVos pages ne sont plus proposées dans ses résultats
Perplexity-UserPerplexityPages ouvertes à la demande d'un utilisateurCe robot ignore en général le robots.txt
GooglebotGoogleRecherche Google, Aperçus IA et mode IAPlus d'indexation, donc aucune citation dans les réponses de Google
Google-ExtendedGoogleJeton qui règle l'usage des contenus pour Gemini (entraînement et ancrage dans les applications Gemini)Aucun effet sur la recherche Google
BingbotMicrosoftRecherche Bing et réponses de CopilotPlus d'indexation dans Bing, donc pas de citation dans Copilot

Une modification du robots.txt peut mettre environ 24 heures à être prise en compte, selon OpenAI et Perplexity. Contrôlez aussi votre hébergeur, votre CDN ou votre pare-feu : certains services de protection bloquent les robots d'IA par défaut, quel que soit le robots.txt. Sur one-online.fr, le robots.txt autorise nommément les robots de recherche et de réponse des principaux assistants, dont OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot et Bingbot.

2. Servir le contenu dans le HTML

Selon l'étude de Vercel et MERJ (décembre 2024), aucun des grands robots d'IA ne rendait le JavaScript : ceux d'OpenAI, d'Anthropic, de Meta, de ByteDance et de Perplexity récupèrent les fichiers JavaScript sans les exécuter. Gemini s'appuie sur Googlebot, qui exécute le JavaScript, et Applebot rend aussi les pages. Conséquence : un texte, un prix ou une FAQ affichés seulement après exécution du JavaScript restent invisibles pour ChatGPT ou Claude.

Le test prend une minute : affichez le code source de la page (Ctrl+U) et cherchez-y votre H1, vos prix et vos réponses. S'ils n'y sont pas, ces robots ne les voient pas. one-online.fr est construit en React, mais chaque page est prérendue au moment de la publication : le HTML reçu par un robot contient déjà le titre, le H1, le texte et les données structurées.

3. Être indexé dans Google et dans Bing

Les IA citent des pages qu'elles trouvent dans un index. Google le dit sans détour : ses fonctionnalités d'IA générative reposent sur ses systèmes de classement habituels, et une page doit être indexée et éligible à l'affichage avec un extrait pour y figurer. Google précise aussi qu'un site doit être inclus dans les fonctionnalités d'IA générative dans la Search Console. Côté Microsoft, Copilot s'appuie sur l'index de Bing, et les consignes de Bing couvrent désormais Copilot et nomment le GEO.

DirectiveEffet sur les réponses des IA
noindexLa page sort de l'index : aucune citation, ni dans Google ni dans Bing
nosnippetLa page n'est plus éligible aux fonctionnalités d'IA générative de Google, qui exigent un extrait ; Bing indique que la qualité des citations peut en pâtir
NOARCHIVE (Bing)Le contenu est exclu des réponses de Copilot
NOCACHE (Bing)Copilot n'utilise que l'URL, le titre et l'extrait
Disallow: OAI-SearchBotLa page disparaît des réponses de recherche de ChatGPT

4. Le fichier llms.txt : utile, mais pas pour Google

Le fichier llms.txt, proposé en septembre 2024 par Jeremy Howard (Answer.AI), résume en Markdown les pages principales d'un site pour les modèles de langage. Ce n'est pas un standard officiel. Google indique que sa recherche, Aperçus IA et mode IA compris, l'ignore, tout en laissant chacun en publier un pour d'autres services. Depuis mai 2026, l'outil d'audit Lighthouse de Chrome vérifie sa présence dans une catégorie consacrée aux agents de navigation, sans lien avec le classement (Search Engine Journal, 20 mai 2026).

Nous en tenons un à jour sur one-online.fr, avec nos offres, nos prix et nos guides, parce qu'il coûte peu et que certains outils le lisent. Mais nous n'en attendons aucun effet sur les citations de Google : les points 1 à 3 passent avant.

5. Données structurées : pour la clarté, pas comme raccourci

Google indique que les données structurées ne sont pas requises pour ses fonctionnalités d'IA générative et qu'aucun balisage schema.org spécial n'est nécessaire, tout en les recommandant pour les résultats enrichis. Bing écrit qu'elles peuvent clarifier le contenu pour l'ancrage des réponses, sans garantir de visibilité, et qu'elles doivent refléter fidèlement le contenu visible. Sur nos pages, le balisage décrit ce que le lecteur voit : organisation, article, questions fréquentes, fil d'Ariane et offres avec leurs prix.

6. Fraîcheur et cohérence de l'entreprise

Bing recommande un sitemap à jour et le protocole IndexNow pour signaler chaque page nouvelle ou modifiée. IndexNow est utilisé par Bing, Yandex, Seznam, Naver, Yep, Internet Archive et Amazon, mais pas par Google, qui découvre les pages par son exploration et la Search Console. Datez vos contenus de façon visible et mettez à jour les pages clés. Enfin, Bing demande des entités définies de façon claire et cohérente : même nom, même adresse, même description sur le site, la fiche Google, LinkedIn, Wikidata et les annuaires.

Ce que Google déconseille explicitement

Dans son guide sur l'IA générative, Google classe parmi les idées reçues : découper le contenu en petits morceaux pour l'IA, réécrire ses textes uniquement pour les systèmes d'IA, rechercher des mentions non authentiques, et créer une page pour chaque variante de requête. Cette dernière pratique enfreint ses règles contre l'abus de contenu à grande échelle. Une page utile par vraie question reste la bonne règle.

La checklist en 12 points

PointComment vérifierSur one-online.fr
Robots de recherche autorisésrobots.txt et réglages de l'hébergeur, du CDN ou du pare-feuAutorisés nommément
Contenu dans le HTMLCode source de la page : H1, prix et FAQ présentsPages prérendues à la publication
Indexation dans GoogleSearch Console, inspection d'URLIndexation demandée à chaque publication
Indexation dans BingBing Webmaster ToolsSite vérifié, citations dans Copilot suivies
Aucune directive d'exclusionnoindex, nosnippet, NOARCHIVE et NOCACHE absents des pages à faire citerAucune sur les pages publiques
Sitemap à jourFichier sitemap.xml avec dates de modificationMis à jour à chaque publication
IndexNowClé à la racine du site, envoi à chaque modificationEnvoyé à chaque publication
Dates visiblesDate de publication et de mise à jour sur la pageSur chaque article
Données structurées fidèlesTest des résultats enrichis de GoogleOrganisation, article, FAQ, fil d'Ariane, offres
Identité cohérenteNom, adresse, téléphone et description identiques partoutSite, fiche Google, LinkedIn, Wikidata
llms.txt (facultatif)Fichier /llms.txt à la racineTenu à jour
MesureRapport sur les performances dans l'IA générative de la Search Console, Bing Webmaster Tools, Microsoft Clarity, panel de questionsRelevé chaque mois

Pour la mesure, Google propose désormais dans la Search Console un rapport sur les performances dans l'IA générative ; côté Microsoft, Bing Webmaster Tools a recensé environ 3 700 citations de one-online.fr dans les réponses de Copilot d'avril à septembre 2026. La méthode complète est dans mesurer sa visibilité dans ChatGPT, Copilot et Gemini. La technique ouvre la porte ; les citations viennent ensuite des contenus et des mentions, que nous travaillons dans notre accompagnement GEO.

Questions fréquentes

Faut-il un fichier llms.txt pour apparaître dans ChatGPT ou dans Google ?

Non. Google indique que sa recherche, Aperçus IA et mode IA compris, ignore llms.txt. D'autres outils peuvent le lire : c'est un complément peu coûteux, pas une condition pour être cité.

Bloquer GPTBot empêche-t-il d'être cité par ChatGPT ?

Non. GPTBot sert à l'entraînement des modèles d'OpenAI. C'est OAI-SearchBot qui fait apparaître les sites dans la recherche de ChatGPT : c'est lui qu'il faut laisser passer.

Les robots d'IA lisent-ils le JavaScript ?

Pas ceux d'OpenAI, d'Anthropic ni de Perplexity, selon l'étude de Vercel et MERJ (décembre 2024) : ils récupèrent les fichiers JavaScript sans les exécuter. Gemini s'appuie sur Googlebot, qui exécute le JavaScript. Le contenu important doit donc figurer dans le HTML.

Quelles directives peuvent exclure un site des réponses de Copilot ?

Selon les consignes de Bing, NOARCHIVE exclut le contenu des réponses de Copilot et NOCACHE le limite à l'URL, au titre et à l'extrait. Un noindex retire la page de l'index, donc de toute réponse.

Les données structurées augmentent-elles les citations ?

Elles ne sont pas requises : Google indique qu'aucun balisage schema.org spécial n'est nécessaire pour ses fonctionnalités d'IA générative, et Bing qu'elles clarifient le contenu sans garantir de visibilité. Elles restent utiles pour les résultats enrichis.

Vérifier votre site point par point

L'audit GEO standard est offert : 20 questions de vos clients testées dans cinq IA, les sources qu'elles citent, l'accès de leurs robots à votre site et un plan sur 90 jours.

Demander mon audit GEO gratuit