Aller au contenu

17/08/2026

GEO : le guide de terrain pour être cité par ChatGPT, Gemini et Perplexity

Vos clients posent désormais leurs questions à ChatGPT, Gemini et Perplexity. Être bien classé sur Google ne garantit plus d’apparaître dans leurs réponses : ce sont deux compétitions différentes. Voici la méthode que nous appliquons, dans l’ordre, et le piège que nous rencontrons le plus souvent.

Le GEO n’est pas du SEO renommé

Le SEO vérifie que Google trouve vos pages. Le GEO vérifie que les IA les citent. Ce sont deux problèmes différents, et un site parfaitement optimisé pour le premier peut être totalement invisible pour le second.

La raison est mécanique. Un moteur classique explore, indexe, classe, puis affiche une liste de liens : votre page est un résultat. Un moteur génératif explore, extrait des passages, les recompose en une réponse unique, et cite ses sources : votre page est une matière première. Dans le premier cas, on optimise une position. Dans le second, on optimise la probabilité qu’un extrait de votre page se retrouve dans une réponse.

Trois conséquences immédiates, qui structurent tout ce qui suit. Le crawler doit pouvoir entrer. Il doit pouvoir lire sans exécuter votre JavaScript. Et il doit trouver des passages autonomes, compréhensibles hors de leur page. La méthode ci-dessous prend ces trois points dans l’ordre où ils bloquent, du plus rédhibitoire au plus subtil.

Étape 1 — Laisser entrer les crawlers IA

C’est le point que nous vérifions en premier, parce que c’est le seul qui puisse annuler tout le reste. Si le robot n’entre pas, aucune optimisation de contenu ne compte.

Un fichier robots.txt classique n’a jamais été écrit pour ces agents. Il faut donc les traiter nommément. Les dix que nous auditons systématiquement :

  • GPTBot — l’entraînement d’OpenAI
  • OAI-SearchBot — l’index de recherche de ChatGPT
  • ChatGPT-User — la consultation en direct, déclenchée par un utilisateur
  • ClaudeBot et anthropic-ai — les agents d’Anthropic
  • PerplexityBot — Perplexity
  • Google-Extended — le contrôle Gemini, distinct de Googlebot
  • Applebot-Extended — le pendant chez Apple
  • CCBot — Common Crawl, qui alimente une grande partie des corpus
  • Bytespider — ByteDance

Deux nuances comptent. Google-Extended n’est pas Googlebot : le bloquer ne vous désindexe pas de Google, mais vous retire de l’entraînement Gemini. Et OAI-SearchBot n’est pas GPTBot : bloquer l’entraînement tout en autorisant la recherche est une position parfaitement défendable, encore faut-il qu’elle soit choisie.

Car c’est le vrai sujet : autoriser ou bloquer est une décision stratégique, pas un réglage par défaut. Le problème que nous rencontrons n’est presque jamais un mauvais choix. C’est un choix que personne n’a fait.

Le piège que nous voyons le plus souvent

Celui-ci mérite sa propre section, parce qu’il est invisible depuis votre site.

Cloudflare propose un robots.txt géré et une fonction Content Signals, qui peuvent bloquer GPTBot, ClaudeBot et leurs confrères sans que rien n’apparaisse dans le fichier que vous éditez. Vous ouvrez votre robots.txt, tout va bien. Le robot, lui, reçoit une autre réponse. Le diagnostic classique passe complètement à côté.

Nous l’avons rencontré sur nos propres sites avant de le rencontrer chez des clients. C’est aujourd’hui le premier point de notre audit GEO, et il se vérifie en une requête : interroger le robots.txt avec l’en-tête User-Agent de chaque robot, et comparer les réponses. C’est ce que fait crawler4seo, l’outil que nous avons construit et que nous publions.

Étape 2 — Être lisible sans JavaScript

Googlebot exécute le JavaScript. La plupart des crawlers IA, non — ou mal, ou avec un budget bien plus serré. Un site dont le contenu principal est injecté côté client peut donc être parfaitement indexé par Google et rigoureusement vide pour un moteur génératif.

Le test tient en une commande : récupérez votre page sans exécuter de script et lisez ce qui reste. Si le texte principal a disparu, vous avez trouvé votre problème, et aucune optimisation éditoriale ne le compensera.

Les corrections vont du rendu serveur à la simple pré-génération des pages critiques. Nous commençons toujours par la deuxième : sur la majorité des sites, une poignée de gabarits porte l’essentiel de la valeur, et il est rarement nécessaire de refondre le front pour les traiter. Le détail des contraintes de crawl — dont la limite de 2 Mo de HTML imposée par Google depuis janvier 2026 — est dans notre article sur le SEO technique.

Le SEO vérifie que Google trouve vos pages. Le GEO vérifie que les IA les citent.

— Robazin/

Étape 3 — Écrire en « réponse d’abord »

Une fois l’accès réglé, tout se joue sur la forme du texte. Un moteur génératif ne cite pas une page : il cite un passage. Votre unité de travail n’est donc plus l’article, c’est le paragraphe.

Quatre règles, que nous appliquons sur tous les contenus que nous produisons — y compris celui-ci.

  1. La réponse dans les deux premières phrases. Pas de mise en contexte, pas d’introduction en entonnoir. L’écriture « réponse d’abord » augmente d’environ 40 % les chances de citation.
  2. Un concept par paragraphe. Un paragraphe qui traite trois idées est inextractible : le moteur ne peut pas en prélever un morceau sans le trahir, donc il ne le prélève pas.
  3. Des passages autonomes. Chaque paragraphe doit se comprendre seul, sorti de sa page. Cela signifie renommer le sujet plutôt que d’écrire « il » ou « cette méthode », et rappeler le contexte au lieu de compter sur ce qui précède.
  4. Des chiffres nommés et sourcés. « Une baisse significative » n’est pas citable. « −58 % de CTR en position 1, selon l’analyse d’Ahrefs sur 300 000 mots-clés » l’est. Un modèle qui doit justifier sa réponse préfère les phrases qui portent leur preuve.

Une conséquence agréable de ces quatre règles : elles rendent aussi le texte plus lisible pour les humains. Ce n’est pas un hasard. Les moteurs génératifs sélectionnent ce qui répond clairement, et les lecteurs aussi.

Étape 4 — Structurer ce que la machine doit comprendre

Trois leviers, dans l’ordre de rendement décroissant.

Schema.org, par type de page. Ce n’est pas une case à cocher globale : un article, une fiche produit, une page service et une FAQ n’ont ni les mêmes types ni les mêmes propriétés obligatoires. C’est le travail le plus fastidieux du lot, et le plus rentable — les LLM s’appuient sur les données structurées pour comprendre le contenu et attribuer leurs citations.

Une FAQ faite des vraies questions de vos clients. Pas des questions inventées pour placer un mot-clé : celles de votre boîte mail et de votre service client. Ce sont, presque littéralement, les prompts que vos prospects taperont.

Un fichier llms.txt à la racine. Il donne aux crawlers IA une vue structurée de vos contenus importants. Son statut reste celui d’une convention, pas d’un standard universel, et personne ne devrait lui attribuer de miracle — mais Perplexity est le moteur qui s’y aligne le plus strictement, et le coût de mise en place est proche de zéro.

La bonne hygiène combine systématiquement les trois : un robots.txt à jour, un llms.txt déclaratif, un Schema.org pertinent. Aucun des trois ne suffit seul.

Étape 5 — Mesurer, sinon rien

Le GEO souffre du même mal que le SEO à ses débuts : beaucoup d’affirmations, peu de mesures. Trois indicateurs suffisent à sortir de l’opinion.

  • La part de citation. Sur un panier de questions représentatives de votre activité, à quelle fréquence votre marque apparaît-elle dans la réponse ? C’est l’équivalent du suivi de positions, appliqué aux réponses générées.
  • Le trafic référent par moteur. Il est faible, il reste utile : ce sont vos premiers visiteurs venus d’une recommandation, et ils convertissent bien.
  • Le volume de recherche de marque. C’est le signal avancé. Quand il monte, les citations suivent — et nous expliquons pourquoi dans l’article consacré à la marque.

Ce que le GEO ne remplace pas

Le GEO ne remplace pas le SEO : il s’y ajoute. Google reste à près de 89 % des recherches en France, et un site invisible pour Googlebot le sera pour tout le monde. Les fondamentaux techniques — indexabilité, performance, maillage interne, qualité éditoriale — sont exactement les mêmes. Ce sont les priorités qui changent.

Et il ne remplace pas non plus le travail de fond. On peut cocher les cinq étapes ci-dessus et rester invisible, simplement parce qu’il n’y a rien à citer : une page qui reformule ce que dix autres disent déjà n’a aucune raison d’être choisie. La technique met votre contenu en état d’être lu. Elle ne le rend pas digne de l’être.

C’est ce qui nous ramène toujours au même endroit : la question réellement posée par un utilisateur, et une réponse qui lui soit utile. Le reste — le robots.txt, le Schema, le llms.txt — n’est que de la plomberie. Indispensable, et insuffisante. Nous détaillons la façon dont nous produisons ces contenus dans l’article sur notre méthode.