Reformuler une question change les sources que ChatGPT cite : 25 expériences
Dans l'AI Sources Index 2026 d'Evocia, 25 questions d'achat de logiciels B2B ont été posées à ChatGPT sous deux formulations, une variable modifiée à la fois (budget, taille d'entreprise, géographie, contrainte technique, persona, formulation négative…), chaque variante quatre fois. La similarité de Jaccard entre les ensembles de domaines cités par les deux variantes est en moyenne de 0,37 (médiane 0,33). À titre de référence, la même question répétée sans changer un mot obtient 0,60. Reformuler change donc les sources plus que ne le fait le hasard d'une répétition. Dans deux expériences, les deux variantes ne partagent aucune source : « open source » et « intégration imposée ».
Ces expériences sont exploratoires : une seule paire de questions par variable, 200 réponses au total. Elles montrent des ordres de grandeur, pas des lois. L'étude complète est sur la page de l'AI Sources Index 2026.
L'essentiel en 60 secondes
- Jaccard moyen entre deux formulations d'une même question : 0,37 (médiane 0,33), sur 25 expériences × 2 variantes × 4 répétitions (200 réponses).
- Référence : la même question répétée, sans reformulation, obtient 0,60 (union des répétitions 1 et 2 contre 3 et 4, 171 questions).
- Les variables qui changent le moins les sources : question courte ou détaillée (0,75), budget (0,71), cas d'usage précis (0,71), demande de classement (0,63).
- Celles qui les changent le plus : open source (0,00), intégration imposée (0,00), question négative (0,125), PME contre grande entreprise (0,125), contrainte technique (0,17).
- Préciser « pour une PME française » a remplacé trois sources sur neuf (Jaccard 0,55) ; ajouter une exigence de conformité RGPD a fait disparaître sept domaines sur dix, américains pour la plupart (0,21).
- Pour une entreprise : la visibilité se mesure sur un panel de formulations, pas sur une question ; un audit fondé sur trois questions décrit trois questions.
Le chiffre : 0,37 contre 0,60
En bref
L'indice de Jaccard mesure le recouvrement entre deux ensembles : domaines communs divisés par domaines de l'union. Pour chaque expérience, on compare l'union des domaines cités par les quatre répétitions de la variante A à celle de la variante B. La moyenne des 25 expériences est de 0,37 ; la médiane de 0,33. La même méthode appliquée à une question non reformulée du corpus principal (union des répétitions 1 et 2 contre union des répétitions 3 et 4) donne 0,60.
| Comparaison | Jaccard moyen | Population | Ce que cela mesure |
|---|---|---|---|
| Même question, répétitions 1-2 contre 3-4 | 0,60 | 171 questions du corpus principal | La variabilité propre du moteur, à formulation constante |
| Deux formulations de la même question | 0,37 (médiane 0,33) | 25 expériences, 200 réponses | La variabilité due à la reformulation, bruit du moteur inclus |
Source : Evocia, AI Sources Index 2026, section « Reformulation ». Les deux mesures utilisent la même définition (union de quatre réponses par côté) pour être comparables.
La différence entre les deux valeurs, 0,23 point, est l'effet propre de la reformulation. Elle est nette, mais elle doit être lue avec la référence : même sans reformuler, 40 % des sources changent d'une paire de répétitions à l'autre. La variabilité à conditions constantes est traitée dans ChatGPT donne-t-il les mêmes sources à chaque fois ?.
Les 25 variables, classées
En bref
Chaque expérience modifie une seule variable. Le tableau classe les 25 variables du recouvrement le plus élevé (la reformulation change peu les sources) au plus faible (elle les remplace). Le nombre moyen de citations par réponse de chaque variante est donné, parce qu'une reformulation change aussi la quantité de sources.
| Variable modifiée | Jaccard A/B | Citations par réponse A → B | Secteur |
|---|---|---|---|
| Question courte ou détaillée | 0,75 | 3,0 → 3,25 | Data et analytics |
| Budget | 0,71 | 3,5 → 4,25 | Marketing automation |
| Cas d'usage précis | 0,71 | 4,75 → 4,5 | Data et analytics |
| Classement demandé | 0,63 | 4,25 → 4,75 | Marketing automation |
| Demande explicite de sources fiables | 0,60 | 3,5 → 5,25 | CRM |
| Contexte métier | 0,57 | 4,0 → 3,5 | Finance |
| Géographie (PME française) | 0,55 | 4,25 → 5,0 | CRM |
| Nombre de recommandations demandé | 0,50 | 3,0 → 3,0 | CRM |
| Persona décideur | 0,50 | 4,0 → 2,0 | Finance |
| Formulation naturelle ou « SEO » | 0,50 | 2,75 → 4,75 | Cybersécurité |
| Remplacement d'un concurrent nommé | 0,40 | 2,5 → 3,25 | Cloud |
| Déploiement rapide | 0,375 | 4,75 → 3,0 | RH |
| Formulation problème ou catégorie | 0,33 | 5,25 → 2,5 | Cloud |
| Découverte ou décision | 0,27 | 2,0 → 4,0 | Service client |
| Taille d'entreprise | 0,25 | 1,75 → 4,0 | RH |
| Marque explicitement introduite | 0,25 | 2,25 → 2,25 | Cybersécurité |
| Exigence de sécurité (ISO 27001) | 0,25 | 2,0 → 3,25 | Legal, compliance |
| ROI | 0,22 | 2,5 → 2,5 | Finance |
| Conformité française (RGPD) | 0,21 | 4,25 → 3,75 | Legal, compliance |
| Recommandation ou comparaison | 0,20 | 5,25 → 3,75 | Service client |
| Contrainte technique (Microsoft 365, Azure) | 0,17 | 3,5 → 3,25 | Cybersécurité |
| PME ou grande entreprise | 0,125 | 4,25 → 4,0 | E-commerce |
| Question négative (« à éviter ») | 0,125 | 2,75 → 2,5 | RH |
| Intégration imposée (Shopify Plus) | 0,00 | 4,0 → 4,5 | E-commerce |
| Open source | 0,00 | 4,75 → 2,25 | Marketing automation |
Dataset B, 25 expériences, 4 répétitions par variante. Une expérience par variable : les valeurs sont des observations, pas des estimations de l'effet de la variable en général. Source : Evocia, AI Sources Index 2026.
Ce que les exemples montrent
En bref
Les sources changent parce que la réponse change de nature : un mot suffit à faire sortir le moteur d'une liste d'éditeurs généralistes pour l'amener vers des éditeurs spécialisés, des institutions, des standards ou des dépôts de code. Cinq expériences l'illustrent.
- « Open source » (Jaccard 0,00). « Quelle plateforme de marketing automation choisir ? » cite sept éditeurs commerciaux. « Quelle plateforme open source de marketing automation… » n'en garde aucun et cite github.com, mautic.org et listmonk.app. Le nombre de citations tombe de 4,75 à 2,25 par réponse.
- Intégration imposée (0,00). « Quel prestataire de paiement choisir ? » cite six prestataires (adyen, mollie, paypal, payplug, stripe, sumup). « … s'il doit impérativement s'intégrer à Shopify Plus ? » ne cite plus que shopify.com.
- Conformité française (0,21). « Quel logiciel de gestion des contrats choisir ? » cite dix domaines, dont sept éditeurs internationaux. « … pour une entreprise française soumise au RGPD ? » fait disparaître ces sept éditeurs, garde trois domaines (dilitrust.com, tomorro.com, docusign.com) et ajoute cnil.fr, avanteam.fr, tacitapp.eu et wolterskluwer.com.
- Géographie (0,55). « Quels sont les meilleurs CRM pour une PME ? » et « … pour une PME française ? » partagent six sources ; la seconde ajoute axonaut.com, brevo.com et nocrm.io et perd monday.com et odoo.com. Détail : ajouter « française » change les sources.
- Demande de sources fiables (0,60). Ajouter « cite uniquement des sources fiables » à une question sur les CRM fait passer de 3,5 à 5,25 citations par réponse, et fait entrer cnil.fr et microsoft.com dans la liste ; folk.app et monday.com en sortent.
- Formulation problème (0,33). « Quels sont les meilleurs outils d'observabilité cloud ? » cite neuf domaines (5,25 citations par réponse). « Mon équipe DevOps manque de visibilité sur les performances de nos applications, quel outil ? » en perd six, n'en garde que trois et tombe à 2,5 citations : la description d'un problème rapproche le moteur du régime de mémoire, décrit dans ChatGPT cherche-t-il toujours sur le web ?.
Ce que cela signifie pour une entreprise
En bref
Une entreprise n'est pas « visible dans ChatGPT » ; elle est visible pour certaines formulations et pas pour d'autres. Une exigence de conformité, une contrainte d'intégration, un mot comme « open source » ou « PME » redessinent la liste des sources. La mesure de la visibilité doit donc porter sur un panel de formulations qui couvre les façons réelles dont les acheteurs posent la question.
- Ce qui est établi : sur ces 25 paires, la reformulation change en moyenne 63 % des sources, et jusqu'à 100 %.
- Ce qui ne l'est pas : l'effet de chaque variable en général. Une expérience par variable ne permet pas de dire que « le budget change peu » ou que « la taille change beaucoup » ; elle montre que c'est arrivé une fois, dans un secteur.
- Conséquence pratique : construire le panel de mesure à partir des variantes que les acheteurs emploient (taille, secteur, contraintes, conformité), pas à partir de la formulation la plus courante. Le protocole est dans mesurer sa visibilité dans ChatGPT et les IA.
Méthode et limites
En bref
Dataset B : 25 expériences, deux variantes chacune, une variable modifiée, quatre répétitions par variante, soit 200 réponses. Ensembles comparés : union des domaines cités sur les quatre répétitions de chaque variante. Référence : même calcul entre les répétitions 1-2 et 3-4 des 171 questions citantes du corpus principal.
- Statut : exploratoire. Une expérience par variable ; aucune n'est répliquée dans un autre secteur.
- Ce que la donnée établit : l'ordre de grandeur de l'effet d'une reformulation sur les sources citées, comparé au bruit du moteur.
- Ce qu'elle n'établit pas : l'effet moyen d'une variable ; l'effet sur les marques recommandées dans le texte (non mesuré) ; le comportement de l'interface grand public.
- Fragilité : les valeurs de Jaccard sur de petits ensembles (deux à neuf domaines) sont sensibles à un seul domaine en plus ou en moins.
Les 50 formulations, leurs domaines cités variante par variante et le calcul du Jaccard sont dans le fichier des expériences A/B publié avec l'étude.
Consulter l'AI Sources Index 2026Questions fréquentes
Reformuler une question change-t-il la réponse de ChatGPT ?
Elle change au moins les sources : sur 25 paires de formulations, les deux variantes ne partagent en moyenne que 37 % de leurs domaines cités, contre 60 % pour la même question répétée. L'étude ne mesure pas le texte de la réponse ni les marques qu'il nomme.
Quelles reformulations changent le plus les sources ?
Dans ces expériences, celles qui ajoutent une contrainte forte : « open source » et « intégration imposée » (aucune source commune), question négative, PME contre grande entreprise, contrainte technique. Celles qui précisent sans contraindre (détail, budget, cas d'usage) changent peu. Une expérience par variable : ces résultats sont indicatifs.
Faut-il tester plusieurs formulations pour mesurer sa visibilité ?
Oui. Une entreprise absente pour « quel CRM pour une PME ? » peut être présente pour « quel CRM pour une PME française ? », et inversement. Un panel de mesure doit couvrir les variantes que les acheteurs emploient réellement, répétées plusieurs fois chacune.
Sources
Transparence et méthode
Auteur
Evocia · Cabinet français de visibilité dans les IA
Evocia mesure la visibilité des entreprises dans les réponses des IA et publie ses données. Cette page fait partie de la série de données de l'AI Sources Index 2026.
Comment cet article a été réalisé
- Page de données publiée le 17 septembre 2026. Chiffres recalculés depuis l'export brut de l'API (dataset B, 200 réponses ; référence sur le corpus principal) ; aucun chiffre saisi à la main.
- Le caractère exploratoire des expériences (une par variable) est rappelé dans chaque section ; aucune valeur n'est présentée comme l'effet général d'une variable.
- Les domaines cités dans les exemples sont ceux du fichier des expériences ; ils sont des sources citées, pas des recommandations.
Historique des mises à jour
- 17 septembre 2026Publication initiale.