Tesseract Studio

Comment ChatGPT choisit ses sources : ce qu’on sait vraiment

Être bien classé sur Google ne suffit pas. Voici comment ChatGPT trie vos questions, récupère ses sources et décide, une fois sur deux, de ne finalement citer personne.

Composition géométrique : documents reliés par de fines lignes convergeant vers un repère rouge, trait noir sur fond papier clair, style suisse.

ChatGPT ne classe pas les pages : il classe d’abord la question

Réponse directe : ChatGPT n’attribue pas de score de classement à des pages web comme Google. Avant même de chercher, il range votre question dans une catégorie interne (recherche instantanée, achat, local, réflexion, ou simple question de connaissance) et cette catégorie décide, à elle seule, si une recherche web a lieu ou non. Une question rangée dans la catégorie « connaissance générale » est répondue depuis la mémoire d’entraînement du modèle, sans recherche, donc sans citation possible, quelle que soit la qualité de votre page.

C’est le point que la plupart des guides GEO passent sous silence : l’optimisation d’une page ne sert à rien si la question qui devrait l’amener ne déclenche jamais de recherche web. Un chercheur ayant analysé le trafic réseau de ChatGPT a documenté ce système de tri interne (le paramètre technique s’appelle turn_use_case) et sa conclusion tient en une phrase : c’est la formulation de la question qui décide de la catégorie, pas son sujet. Deux questions portant sur le même thème peuvent prendre deux chemins complètement différents selon la façon dont elles sont posées. « Qu’est-ce qu’un audit SEO » a de bonnes chances d’être traitée comme une question de connaissance générale ; « meilleur outil d’audit SEO 2026 » bascule presque toujours en recherche active, parce que le mot « meilleur » signale une comparaison à trancher plutôt qu’une définition à rappeler.

Entre la question et la réponse : la mécanique réelle

Quand une recherche web est déclenchée, ChatGPT ne se contente pas d’envoyer votre question telle quelle à un moteur. Une analyse portant sur environ 50 000 prompts a montré que le système la découpe en plusieurs sous-requêtes, envoyées en parallèle à différents moteurs, une technique connue sous le nom de query fan-out. Les résultats de ces sous-requêtes sont ensuite récupérés, filtrés, puis synthétisés dans la réponse finale. C’est cette étape de synthèse qui distingue fondamentalement un moteur de réponse d’un moteur de recherche classique : vous ne concourez plus pour une position dans une liste, vous concourez pour être la phrase retenue dans un résumé.

Le mode recherche de ChatGPT s’appuie largement sur l’index de Bing pour récupérer du contenu récent. Concrètement, un contenu absent de l’index Bing part avec un désavantage structurel, indépendamment de sa qualité éditoriale. C’est un point que beaucoup d’entreprises suisses romandes découvrent tard : leur Search Console Google est suivie de près, leur présence sur Bing Webmaster Tools n’a jamais été configurée.

Les pipelines cachés derrière la réponse

Des chercheurs indépendants (Chris Green et Suganthan Mohanadasan, travaux publiés à la mi-juillet 2026) ont mis en évidence, en observant le trafic réseau du mode recherche, quatre canaux de récupération distincts qui opèrent en coulisse, invisibles dans les cartes de citation affichées à l’utilisateur.

CanalCe qu’il privilégieType de requête typique
LabradorPresse établie et sources de référence (agences de presse, encyclopédies)Actualité, questions factuelles générales
BrightContenu commercial et transactionnelAchat, shopping, finance, météo
OxylabsPresse régionale et localeRequêtes géolocalisées
SERPWeb ouvert, sans filtre éditorial particulierActualité de type divers

Un chiffre mérite d’être cité avec précaution plutôt que présenté comme une loi : dans l’échantillon de Suganthan Mohanadasan (environ 1 240 enregistrements de sources sur quelques jours, un seul compte), Labrador représentait la grande majorité des récupérations. L’auteur lui-même prévient que ses pourcentages indiquent une direction, pas une mesure fiable : son échantillon reste petit et orienté vers des requêtes SaaS et commerciales. Un autre chercheur, sur un échantillon différent, a observé Bright jouer un rôle bien plus large sur les requêtes commerciales. Retenez le principe plutôt que le chiffre : le canal utilisé dépend du type de requête, pas d’un classement universel.

Ce même travail de recherche a révélé un écart révélateur entre être récupéré et être cité. Sur l’échantillon observé, Reddit a été récupéré 278 fois mais cité seulement 11 fois ; YouTube a été récupéré 201 fois et cité 0 fois. Être présent dans le contexte que le modèle consulte ne garantit donc rien : la citation est un filtre supplémentaire, appliqué après la récupération. Les chercheurs ont aussi observé que 11,6 % des questions changeaient de canal principal d’une exécution à l’autre : quand ce changement se produit, le recouvrement des URLs récupérées chute d’environ 45 %. La réponse de ChatGPT à une même question n’est donc pas figée, elle varie dans le temps, ce qui explique pourquoi un suivi ponctuel ne dit jamais grand-chose à lui seul.

Ce qui pèse vraiment sur la citation, une fois la recherche déclenchée

Une étude publiée par Discovered Labs, portant sur les citations de ChatGPT, montre que ses citations affichent un taux d’alignement de 87 % avec les résultats en tête de Bing : être bien positionné sur Bing (pas seulement Google) reste le socle le plus fiable pour espérer une citation. Wikipédia à elle seule représente près de la moitié (47,9 %) des citations parmi les dix sources les plus citées par ChatGPT, ce qui confirme une préférence nette pour du contenu à structure encyclopédique, avec des définitions claires et des entités bien identifiées.

Un second chiffre relativise le premier plutôt qu’il ne le contredit : une analyse d’Ahrefs portant sur 15 000 requêtes a mesuré que seulement 12 % des URLs citées par les outils d’IA figurent aussi dans le top 10 de Google sur ces mêmes requêtes. Les deux chiffres cohabitent parce qu’ils mesurent des choses différentes : l’alignement avec Bing porte sur l’index utilisé pour la recherche, le chevauchement avec Google porte sur le classement final. Une page peut être indexée et récupérable sans jamais apparaître en tête d’un classement Google classique, et se retrouver malgré tout citée.

La fraîcheur du contenu joue également un rôle mesuré, documenté cette fois sur Perplexity : un contenu mis à jour dans les 30 derniers jours reçoit 3,2 fois plus de citations qu’un contenu plus ancien sur le même sujet. Rien ne garantit un ratio identique chez ChatGPT, mais le principe (un contenu daté et régulièrement révisé inspire davantage confiance à un système de synthèse) se retrouve dans la plupart des moteurs de réponse. Une entité clairement identifiée (nom d’entreprise, lieu, offre) balisée par des données structurées facilite aussi la tâche du modèle au moment de décider si une page répond précisément à la sous-requête générée, un sujet que nous traitons séparément dans notre article sur les types Schema.org qui comptent pour les moteurs de réponse.

Être récupéré, être cité, être mentionné : trois choses différentes

Une page peut connaître trois sorts distincts face à ChatGPT : être récupérée dans le contexte sans jamais apparaître à l’utilisateur, être citée comme source d’une phrase précise avec un lien visible, ou voir sa marque mentionnée sans qu’aucune de ses pages ne serve de source à la réponse. Ce sont trois niveaux de résultat très différents, et confondre les trois conduit à surestimer ou sous-estimer sa visibilité réelle dans les moteurs de réponse.

Le premier cas (récupéré, non cité) est le plus fréquent et le moins visible : c’est le sort de la majorité des pages Reddit et YouTube mentionnées plus haut. Le deuxième cas (cité avec lien) est celui que mesurent les outils de suivi GEO. Le troisième cas (mention de marque sans source) vient de la mémoire d’entraînement du modèle : votre nom peut apparaître dans une réponse construite uniquement à partir de ce que le modèle a appris pendant son entraînement, sans qu’aucune requête web n’ait eu lieu, une piste totalement indépendante de vos pages actuelles.

Quand ce sujet ne devrait pas être votre priorité

Si l’essentiel de votre trafic potentiel correspond à des questions classées en interne comme « connaissance générale » (définitions, historique, questions factuelles stables), optimiser vos pages pour la citation ne changera rien : ces questions ne déclenchent aucune recherche web, la réponse vient entièrement de la mémoire d’entraînement. Dans ce cas, l’effort a plus de sens investi dans le référencement Google classique, qui influence indirectement ce que le modèle a appris lors de son dernier entraînement, plutôt que dans une optimisation de citation en temps réel qui ne sera jamais consultée.

De même, si votre activité repose sur des requêtes très locales et transactionnelles (un artisan, un commerce de proximité sans contenu informationnel), le canal Oxylabs et les fiches d’établissement pèsent davantage que la structure d’un article de blog. Publier du contenu long pour espérer une citation coûte alors plus cher que ça ne rapporte : mieux vaut consolider sa présence sur les annuaires professionnels et les avis, qui alimentent directement ce canal.

Ce qu’on peut réellement faire

  1. Être bien indexé sur Google ET sur Bing. Les deux index alimentent des pipelines différents ; négliger Bing revient à se couper d’un canal qui aligne 87 % des citations observées.
  2. Écrire des passages autonomes. Une définition ou une réponse qui garde son sens sortie de son contexte a plus de chances d’être retenue dans une synthèse qu’un paragraphe qui suppose d’avoir lu tout l’article.
  3. Rendre le contenu accessible sans exécution JavaScript côté client. Un robot qui ne peut pas récupérer le contenu ne peut ni le fetcher ni le citer (voir notre article sur le piège du rendu côté serveur).
  4. Construire une présence sur des sources tierces à forte autorité éditoriale (presse spécialisée, annuaires professionnels reconnus) plutôt que de compter uniquement sur l’autorité de son propre domaine.
  5. Actualiser régulièrement le contenu qui compte le plus, avec une date visible : c’est un signal de fraîcheur mesurable, pas un simple réflexe éditorial.

Ce que cela change pour une PME romande

La conclusion pratique n’est pas qu’il faut ignorer le SEO classique pour se concentrer sur le GEO, ni l’inverse : les deux pipelines se nourrissent largement des mêmes index. Le classement Google et Bing d’une page reste le meilleur prédicteur de sa probabilité d’être un jour récupérée puis citée. La différence se joue ensuite dans la structure : une page bien classée mais rédigée comme une brochure marketing sera récupérée puis écartée au moment de la synthèse, faute de phrase citable. Pour un état des lieux complet des six leviers qui influencent cette visibilité, notre panorama du GEO et des moteurs de réponse IA reste le point de départ, et notre analyse des robots GPTBot, ClaudeBot et PerplexityBot complète ce mécanisme côté accès technique. Pour une PME romande qui veut savoir où elle en est avant d’investir du temps, le Sprint GEO part d’un audit concret plutôt que d’une supposition.

Questions fréquentes

Être bien classé sur Google garantit-il d’être cité par ChatGPT ?

Non. C’est un avantage réel mais pas suffisant : une étude Ahrefs sur 15 000 requêtes montre que seulement 12 % des URLs citées par les outils d’IA figurent aussi dans le top 10 Google sur la même requête. L’alignement le plus fort mesuré est avec Bing (87 %), pas avec Google.

Pourquoi ChatGPT cite parfois une page sans jamais l’avoir montrée à l’utilisateur ?

Une page peut être récupérée dans le contexte que le modèle consulte sans jamais apparaître à l’écran, si elle n’est finalement pas retenue au moment de la synthèse. Dans un échantillon étudié, Reddit a été récupéré 278 fois mais cité seulement 11 fois : la récupération et la citation sont deux filtres distincts.

Le référencement sur Bing compte-t-il vraiment pour être cité par ChatGPT ?

Oui, davantage qu’on ne le pense généralement : le mode recherche de ChatGPT s’appuie largement sur l’index Bing pour récupérer du contenu récent, et les citations observées s’alignent à 87 % avec le classement Bing.

Une question posée différemment peut-elle changer la source citée par ChatGPT ?

Oui. ChatGPT classe chaque question dans une catégorie interne avant de décider s’il déclenche une recherche web, et cette catégorie dépend de la formulation, pas seulement du sujet. Deux formulations d’une même question peuvent donc emprunter des chemins de récupération différents.

Sources
À lire aussi