Aller au contenu
Evocia
Toutes les ressources

Données

ChatGPT donne-t-il les mêmes sources quand on pose quatre fois la même question ?

Par Evocia17 septembre 2026· 8 min de lecture

Partager

Dans l'AI Sources Index 2026 d'Evocia, chacune des 200 questions du corpus principal a été posée quatre fois à ChatGPT, par des appels indépendants, dans une fenêtre de 25 minutes. Sur les 870 couples « question × domaine cité » ainsi obtenus, 333 (38,3 %) n'apparaissent que dans une réponse sur quatre, 157 (18,1 %) dans deux, 144 (16,6 %) dans trois et 236 (27,1 %) dans les quatre. La similarité moyenne entre deux répétitions d'une même question, mesurée par l'indice de Jaccard sur les domaines cités, est de 0,55. Vingt et une requêtes sur 157 (13,4 %) ont cité exactement le même ensemble de domaines à chacune des quatre répétitions.

Ces chiffres ne mesurent pas une dérive dans le temps : les quatre répétitions ont eu lieu dans la même demi-heure, avec le même modèle et les mêmes réglages. Ils mesurent la variabilité propre du moteur, à conditions constantes. L'étude complète est sur la page de l'AI Sources Index 2026.

L'essentiel en 60 secondes

  • Sur 870 couples question × domaine, 38,3 % n'apparaissent que dans une réponse sur quatre ; 27,1 % apparaissent dans les quatre. Stabilité moyenne : 0,58 (une source citée l'est en moyenne dans 2,3 réponses sur 4).
  • La similarité de Jaccard moyenne entre les ensembles de domaines de deux répétitions d'une même question est de 0,55 (165 questions ayant au moins deux réponses citantes).
  • 13,4 % des requêtes (21 sur 157) ont obtenu exactement les mêmes domaines aux quatre répétitions.
  • La variabilité dépend de l'intention : pour une comparaison de solutions nommées, 42,5 % des sources sont présentes à chaque fois (Jaccard 0,74) ; en découverte de solutions, 17,3 % (Jaccard 0,41).
  • Elle dépend aussi du secteur : stabilité de 0,69 en e-commerce, 0,45 en legal et conformité.
  • Conséquence : une capture d'écran n'est pas une mesure. Une visibilité se relève sur plusieurs répétitions, et se compare à une référence de variabilité.

Le chiffre : quatre répétitions, quatre listes de sources

En bref

Une source citée pour une question donnée l'est, en moyenne, dans 2,3 des 4 répétitions. La distribution est bimodale : le plus gros groupe de sources (38,3 %) n'apparaît qu'une fois, le second (27,1 %) apparaît à chaque fois. Entre les deux, 34,6 % des sources apparaissent deux ou trois fois.

Nombre de répétitions où la source est citée (sur 4)Couples question × domainePart
1 sur 433338,3 %
2 sur 415718,1 %
3 sur 414416,6 %
4 sur 423627,1 %

Corpus principal : 200 questions × 4 répétitions ; 171 questions ont au moins une citation ; 870 couples distincts. Source : Evocia, AI Sources Index 2026.

La lecture par requête est plus parlante encore. Sur les 157 questions qui ont déclenché une recherche aux quatre répétitions, 21 ont produit exactement le même ensemble de domaines quatre fois. Les 136 autres ont vu au moins une source apparaître ou disparaître d'une répétition à l'autre. Une entreprise qui constate sa présence dans une réponse a donc, en moyenne, un peu plus d'une chance sur deux d'y être encore à la répétition suivante.

À retenir

Formulation citable : « Dans l'AI Sources Index 2026 d'Evocia, quand une même question d'achat B2B est posée quatre fois à ChatGPT dans la même demi-heure, 38 % des sources citées n'apparaissent que dans une réponse sur quatre, et 13 % des questions seulement obtiennent le même ensemble de sources à chaque fois. »

L'indice de Jaccard : 0,55 entre deux réponses à la même question

En bref

L'indice de Jaccard compare deux ensembles : domaines communs divisés par domaines de l'union. Il vaut 1 quand deux réponses citent exactement les mêmes domaines, 0 quand elles n'en partagent aucun. Sur les 165 questions ayant au moins deux réponses citantes, la moyenne des six paires possibles entre les quatre répétitions est de 0,55. En pratique : deux réponses à la même question partagent un peu plus de la moitié de leurs sources.

Cette valeur sert de référence dans le reste de l'étude. Quand on reformule une question, la similarité entre les deux formulations tombe à 0,37 : la reformulation change donc plus les sources que le hasard d'une répétition, mais moins qu'on pourrait le croire, puisque même sans changer un mot, on ne retrouve que 55 % des sources. Le détail est dans reformuler une question change les sources de ChatGPT.

Une autre façon de le dire : sur 165 questions, 21 (12,7 %) ont un ensemble de domaines identique sur toutes leurs répétitions citantes. Pour les 144 autres, la liste des sources d'une réponse est une version parmi plusieurs, pas la liste.

La stabilité dépend de ce qu'on demande

En bref

Plus la question est précise, plus les sources sont stables. Une comparaison de solutions nommées (« X ou Y ? ») obtient 42,5 % de sources présentes aux quatre répétitions et un Jaccard de 0,74. Une question de découverte (« quels types d'outils existent pour… ») n'en obtient que 17,3 %, avec un Jaccard de 0,41.

IntentionCouples question × domainePrésents 1 fois sur 4Présents 4 fois sur 4Stabilité moyenneJaccard entre répétitions
Comparaison16724,6 %42,5 %0,690,74 (40 questions)
Décision ou achat20438,7 %31,4 %0,600,56 (40)
Recommandation27639,9 %22,1 %0,560,46 (38)
Découverte de solutions19745,2 %17,3 %0,520,41 (38)
Problème ou besoin2653,8 %23,1 %0,520,63 (9)

Corpus principal. L'intention « problème » compte peu de couples (26) parce que ChatGPT y cherche rarement ; son Jaccard porte sur 9 questions seulement et n'est pas interprétable. Source : Evocia, AI Sources Index 2026.

L'explication la plus simple tient au nombre de candidats : une comparaison entre deux produits nommés a peu de sources possibles (les deux éditeurs, parfois leur documentation), une découverte de catégorie en a des dizaines. L'étude n'a pas testé cette explication, mais elle est cohérente avec le nombre de domaines distincts par intention : 105 en comparaison, 158 en recommandation. La page stabilité des sources selon l'intention développe ce point.

Et du secteur

En bref

La stabilité moyenne va de 0,69 en e-commerce et paiements à 0,45 en legal, compliance et RegTech. Les secteurs où quelques éditeurs dominent (e-commerce, marketing automation, CRM) sont plus stables que ceux où les sources sont dispersées (legal, finance).

SecteurStabilité moyenneDomaines citésSecteurStabilité moyenneDomaines cités
E-commerce et paiements0,6934Service client et CCaaS0,6029
Marketing automation0,6638RH et recrutement0,5739
Data et analytics0,6531Cybersécurité0,5633
CRM et ventes0,6217Finance et dépenses0,4945
Cloud et infrastructure0,6233Legal, compliance, RegTech0,4572

80 réponses par secteur. Source : Evocia, AI Sources Index 2026.

Ce que cela change pour la mesure

En bref

Une présence observée une fois est une observation, pas une visibilité. Pour mesurer, il faut répéter chaque question plusieurs fois, dans des conditions identiques, et rapporter la présence d'une entreprise au nombre de répétitions. Il faut aussi disposer d'une référence de variabilité, comme le Jaccard de 0,55 mesuré ici, pour savoir si un changement observé dépasse le bruit du moteur.

  • Répéter : quatre répétitions donnent déjà une distribution lisible ; la page combien de fois répéter une requête discute le nombre nécessaire.
  • Comparer à une référence : un écart de sources entre deux relevés n'est un signal que s'il dépasse la variabilité à conditions constantes.
  • Distinguer les sources fidèles des sources occasionnelles : certains domaines sont présents presque à chaque fois qu'ils apparaissent (shopify.com : 0,98), d'autres une fois sur deux (cnil.fr : 0,49). Voir les sites cités le plus régulièrement.
  • Ne pas confondre avec la dérive dans le temps : d'autres études mesurent le renouvellement des sources d'une semaine à l'autre ; cette mesure-ci porte sur la même demi-heure. Les deux phénomènes s'additionnent.

Méthode et limites

En bref

Quatre appels indépendants par question (sans historique, sans cache), même modèle (gpt-5.6-terra), mêmes réglages, fenêtre de 25 minutes le 14 septembre 2026. Une paire question × domaine compte le nombre de répétitions où le domaine est cité. Le Jaccard est calculé sur les ensembles de domaines, pas d'URL : au niveau des URL, la variabilité serait plus forte.

  • Population : corpus principal, 200 questions, 800 réponses, 171 questions avec citation, 870 couples.
  • Ce que la donnée établit : la variabilité des sources citées à conditions constantes, pour ce modèle et cette configuration.
  • Ce qu'elle n'établit pas : la variabilité des marques recommandées dans le texte (non mesurée) ; la variabilité de l'interface grand public ; la dérive dans le temps ; les causes de la variabilité (le réglage de température n'a pas été envoyé, les défauts de l'API s'appliquent).

Le fichier des citations, avec l'identifiant de répétition de chaque réponse, permet de recalculer ces distributions avec d'autres seuils.

Consulter l'AI Sources Index 2026

Questions fréquentes

Pourquoi ChatGPT ne donne-t-il pas la même réponse deux fois ?

La génération d'un modèle de langage est probabiliste : à réglages égaux, deux appels peuvent produire des recherches légèrement différentes, donc des pages différentes, donc des citations différentes. L'étude mesure l'ampleur du phénomène sur les sources (Jaccard 0,55 entre deux répétitions) sans en analyser les causes internes.

Une source présente dans les quatre répétitions est-elle « acquise » ?

Non. Elle est stable à conditions constantes, à une date donnée. Un changement de modèle, d'index ou de formulation peut la faire disparaître. Dans l'étude, la reformulation d'une question fait tomber la similarité à 0,37.

Combien de répétitions faut-il pour mesurer une visibilité ?

Assez pour que la présence d'une entreprise soit rapportée à une distribution plutôt qu'à une observation. Quatre répétitions ont suffi ici à distinguer sources fidèles (27 %) et occasionnelles (38 %). Le nombre dépend de la précision recherchée ; la page dédiée en discute.

Sources

Transparence et méthode

Auteur

Evocia · Cabinet français de visibilité dans les IA

Evocia mesure la visibilité des entreprises dans les réponses des IA et publie ses données. Cette page fait partie de la série de données de l'AI Sources Index 2026.

Comment cet article a été réalisé

  • Page de données publiée le 17 septembre 2026. Chiffres recalculés depuis l'export brut de l'API (corpus principal, 800 réponses) ; aucun chiffre saisi à la main.
  • Stabilité d'une paire = nombre de répétitions (sur 4) où le domaine est cité pour la question. Jaccard = domaines communs / domaines de l'union, moyenné sur les six paires de répétitions d'une question puis sur les questions.
  • Les explications avancées (nombre de candidats par intention) sont des hypothèses non testées, signalées comme telles.

Historique des mises à jour

  • 17 septembre 2026Publication initiale.

À lire aussi

Commencez par le test gratuit : 3 requêtes, une synthèse claire.

Sans engagement · Nombre limité d'analyses gratuites chaque semaine

Tester ma visibilité IA