Comment mesurer sa visibilité dans ChatGPT et les IA
Mesurer sa visibilité dans les IA ne consiste pas à poser quelques questions à ChatGPT et à conserver des captures d'écran. Une même question, posée deux fois, peut donner deux réponses différentes : la génération est probabiliste, et le résultat dépend du moteur, du mode (avec ou sans recherche web), du compte, de la langue et du moment. Une observation isolée documente un cas ; elle ne mesure rien.
Ce guide donne la méthode complète : ce que l'on mesure exactement, comment construire un panel de requêtes, combien de fois les répéter, quels indicateurs calculer, comment lire un résultat sans le sur-interpréter, et comment passer de la mesure à l'action. Il décrit aussi, paramètre par paramètre, le protocole qu'Evocia applique à ses propres campagnes, publié pour être vérifié et critiqué.
L'essentiel en 60 secondes
- La visibilité dans les IA est une fréquence, jamais un état : la part des relevés où une marque est nommée, sur un panel de requêtes figé, répété dans des conditions constantes et datées.
- Mention, recommandation, citation d'une source et lien vers un domaine sont quatre variables différentes. Les confondre fausse toute analyse.
- Le panel de requêtes se construit avant la mesure, à partir des questions réelles des acheteurs, segmenté par intention, et ne change plus d'une campagne à l'autre.
- Cinq répétitions par requête sont un minimum opérationnel ; le protocole Evocia en fait dix, sur cinq moteurs, en session neuve. Un taux se publie toujours avec son nombre d'observations.
- Un tableau de bord combine plusieurs indicateurs (mention, recommandation, rang, part de voix, citation du domaine, exactitude), jamais un score unique et opaque.
- Chaque moteur se mesure séparément : ChatGPT, Claude, Gemini, Perplexity, Copilot et les fonctions IA de Google n'ont ni les mêmes sources ni la même unité d'observation.
- Une évolution mesurée n'est pas une preuve de causalité : groupes de requêtes témoins, journal des actions et formulation au conditionnel sont indispensables.
- Le protocole Evocia est public : 20 requêtes sur 6 secteurs, 10 répétitions, 5 moteurs, 1 000 relevés par campagne, formule du score reproductible à la main. Aucun résultat n'est publié avant qu'une campagne complète ait été validée.
Qu'est-ce que la visibilité dans les IA ?
En bref
La visibilité dans les IA désigne la fréquence, la position, le contexte et l'exactitude avec lesquels une marque, un produit ou son contenu apparaît dans les réponses générées, pour un ensemble défini de requêtes, de moteurs, de modes, de langues et de dates. C'est une définition opérationnelle, pensée pour être reproductible, pas une norme officielle.
Quatre variables se cachent derrière le mot « visible », et elles ne se recouvrent pas. Une mention nomme la marque. Une recommandation la présente comme une option adaptée au besoin. Une citation rattache la réponse à une source, souvent avec un lien. Un lien vers le domaine pointe vers votre site. On peut être mentionné sans être recommandé, cité via une page tierce sans que votre site soit la source, ou recommandé sans aucune citation visible. Interpréter ces écarts renvoie aux causes analysées dans pourquoi votre entreprise est invisible dans les réponses des IA.
| Variable | Ce qu'elle indique | Exemple |
|---|---|---|
| Mention | La marque est nommée | « Parmi les options : Marque X » |
| Recommandation | La marque est conseillée pour le besoin | « Pour ce cas, Marque X convient bien » |
| Citation d'une source | La réponse s'appuie sur une source identifiée | Une fiche d'avis citée en référence |
| Lien vers le domaine | Un lien pointe vers votre site | Lien cliquable vers votre page |
Quatre variables, quatre dénominateurs. Un taux de citation du domaine, par exemple, ne se calcule que sur les réponses qui affichent des sources.
| Dimension | Question | Indicateur type |
|---|---|---|
| Marque | Êtes-vous mentionné ? | Taux de mention |
| Recommandation | Êtes-vous conseillé ? | Taux de recommandation |
| Position | À quel rang ? | Rang moyen, présence dans les trois premiers |
| Thématique | Sur quels besoins ? | Couverture par intention |
| Documentaire | Votre domaine est-il cité ? | Taux de citation du domaine |
| Descriptive | Comment êtes-vous décrit ? | Exactitude descriptive |
| Concurrentielle | Quelle part de l'espace ? | Part de voix |
| Transactionnelle | Sur les requêtes d'achat ? | Présence par étape du parcours |
Les dimensions de la visibilité. Aucune ne résume les autres ; un tableau de bord en combine plusieurs.
Étude Evocia : AI Sources Index 2026
Ce que donne le protocole appliqué à un marché entier, mesure Evocia du 14 septembre 2026 sur ChatGPT (API avec recherche web, 200 requêtes B2B × 4 répétitions) : 38,3 % des paires requête × domaine n'apparaissent que dans une réponse sur quatre, 27,1 % dans les quatre, et seules 13 % des requêtes donnent quatre fois le même ensemble de sources. C'est la raison de la mesure en fréquence. Graphiques et données : Evocia AI Sources Index 2026.
Pourquoi une seule réponse ne mesure rien
En bref
Parce que la génération est probabiliste et que le résultat dépend de la formulation, du compte, du moteur, du mode et du moment. Deux observations séparées de quelques minutes peuvent différer sans qu'aucune action de l'entreprise observée n'en soit la cause. On ne conclut donc pas sur une réponse : on échantillonne, à conditions documentées et constantes, et on consigne une fréquence.
| Source de variation | Exemple | À faire |
|---|---|---|
| Génération probabiliste | Deux tirages, deux formulations, deux listes | Répéter, agréger |
| Formulation de la question | « meilleur X » et « X pour une PME » ne donnent pas la même réponse | Figer et versionner les formulations |
| Compte et personnalisation | Historique, mémoire, langue du profil | Session neuve, conditions documentées |
| Moteur, modèle, mode | Réponse standard ou avec recherche web | Segmenter, ne jamais mélanger |
| Moment | Actualité, mise à jour du modèle ou de l'index | Dater chaque relevé |
Cinq sources de variation qui se combinent. Aucune ne s'élimine ; toutes se documentent.
Une capture d'écran reste utile : elle documente une réponse datée, conserve une preuve, illustre une erreur. Ce qu'elle ne permet pas, c'est l'inférence : estimer une probabilité d'apparition, généraliser à tous les utilisateurs, comparer deux périodes, attribuer une cause à un changement. Le problème n'est jamais la capture, c'est ce qu'on lui fait dire.
Le critère qui départage une mesure d'une impression
Une mesure est reproductible : un tiers disposant du panel de requêtes, du nombre de répétitions et des conditions de test doit pouvoir refaire le travail et obtenir des résultats comparables. C'est la seule raison pour laquelle Evocia publie ses paramètres plutôt que de les garder pour elle.
Construire le panel de requêtes
En bref
Un protocole commence par trois décisions : l'objectif de la mesure (état des lieux, benchmark, suivi d'actions, contrôle de réputation), le périmètre (pays, langue, moteurs, modes, concurrents, période) et le panel de requêtes, segmenté par intention et figé avant toute mesure. Un panel modifié en cours de route produit une mesure qui reflète le choix des questions autant que la réalité observée.
Les requêtes doivent refléter les questions réelles de vos acheteurs, formulées comme ils les posent et non comme des mots-clés de référencement. Puisez-les dans les entretiens clients, les appels commerciaux, les tickets de support, la Search Console, les appels d'offres et les forums. Segmentez-les par intention : catégorie, besoin métier, secteur, taille d'entreprise, fonctionnalité, comparaison, alternative, contrainte, prix, requête de marque.
| Famille | Intention | Étape du parcours | Exemple |
|---|---|---|---|
| Catégorie | Découverte | Haut | « Meilleurs logiciels RH pour une PME française » |
| Cas d'usage | Considération | Milieu | « Outil de signature électronique conforme pour un grand compte » |
| Comparaison | Considération | Milieu | « Alternatives à [concurrent] pour 500 salariés » |
| Contrainte | Décision | Bas | « Logiciel RH avec authentification unique et hébergement européen » |
| Marque | Réputation | Transverse | « Que vaut [votre marque] ? » |
Cinq familles de requêtes. Les requêtes de marque se mesurent à part : mélangées aux requêtes de catégorie, elles gonflent artificiellement la visibilité.
Attention
Si vous pondérez certaines requêtes (les transactionnelles, par exemple), fixez la pondération avant l'analyse et conservez les résultats bruts à côté du score pondéré. Une pondération décidée après coup est une façon de choisir son résultat.
Exécuter : conditions, répétitions, archivage
En bref
L'exécution obéit à cinq règles : figer et versionner les formulations, documenter les conditions de session, répéter chaque requête, archiver les réponses brutes, annoter selon un guide stable. Sans ces règles, deux campagnes ne sont pas comparables.
Figer les formulations et documenter la session
Chaque question reçoit un identifiant et une version. Ponctuation, langue, longueur, demande de sources, nombre de recommandations demandées : tout est fixé. Pour chaque relevé, enregistrez le moteur, le modèle affiché, le mode (avec ou sans recherche), la date et l'heure, le pays, la langue, l'appareil, le statut connecté ou non, la mémoire activée ou non, et un identifiant d'exécution.
Exécuter en session neuve
OpenAI documente que, lorsque la mémoire d'un utilisateur est activée, elle peut enrichir la requête effectivement envoyée aux systèmes de recherche. Un relevé effectué depuis un compte professionnel qui a discuté cent fois d'un produit ne mesure donc pas la visibilité de ce produit, mais l'historique de ce compte. D'où la règle : navigation privée, sans compte connecté, mémoire et personnalisation désactivées quand l'option existe, sans historique de conversation.
La langue et la localisation se fixent pour la même raison : elles modifient les sources que les moteurs mobilisent. Une mesure conduite en anglais depuis un autre pays observe un autre écosystème de sources. Une réponse constitue une observation : une marque nommée plusieurs fois dans la même réponse compte une seule fois, et le rang retenu est celui de sa première apparition. Sans cette règle, une réponse bavarde produirait mécaniquement un meilleur résultat qu'une réponse concise.
Répéter, sans seuil magique
Cinq répétitions par requête sont un minimum opérationnel, pas une loi. Cinq observations laissent une incertitude large, dix la réduisent modérément. Le bon nombre dépend de la précision recherchée et du budget : il faut arbitrer entre couvrir plus de requêtes et répéter davantage. Pour mesurer une stabilité, répartissez les relevés sur des jours et des heures différents.
| Niveau | Usage | Requêtes | Répétitions | Limite |
|---|---|---|---|---|
| Exploratoire | Détecter des tendances | 10 à 20 | 3 à 5 | Non généralisable |
| Standard | Tableau de bord régulier | 20 à 50 | 5 à 10, réparties dans le temps | Incertitude encore notable |
| Renforcé | Étude publiable | 50 et plus | 10 et plus, réparties | Coût et temps d'annotation |
Repères opérationnels Evocia, pas des standards scientifiques.
Archiver et annoter
Conservez le texte complet de chaque réponse, les liens et citations, la date, la question exacte, le moteur, le mode et un identifiant unique, dans un format réanalysable. Puis annotez selon un guide écrit : marque citée et ses variantes, rang, présence dans les trois premiers, recommandation explicite, exactitude de la description, lien vers le domaine, sources citées, concurrents présents. Contrôlez la qualité par une double annotation sur un sous-échantillon. L'archive est ce qui permet, si la définition d'un indicateur est affinée, de recalculer la série entière sans refaire les relevés.
Les indicateurs à suivre
En bref
Un tableau de bord minimal combine plusieurs indicateurs, jamais un seul : taux de mention, taux de recommandation, présence dans les trois premiers, rang moyen conditionnel, couverture des requêtes et des moteurs, part de voix, taux de citation du domaine, exactitude descriptive. Chaque indicateur n'a de sens que si son dénominateur et ses conditions sont déclarés.
| Indicateur | Formule | Lecture |
|---|---|---|
| Taux de mention | réponses nommant la marque ÷ réponses éligibles × 100 | Probabilité d'apparaître |
| Taux de recommandation | réponses la recommandant ÷ réponses éligibles × 100 | Présence qualifiée |
| Présence dans les trois premiers | réponses où la marque est dans les trois premiers noms ÷ réponses × 100 | Visibilité forte |
| Rang moyen conditionnel | moyenne du rang quand la marque apparaît | À lire avec la fréquence |
| Couverture des requêtes | requêtes où la marque apparaît au moins une fois ÷ requêtes × 100 | Étendue de la présence |
| Couverture des moteurs | moteurs où la marque apparaît ÷ moteurs testés | Présence multi-moteurs |
| Part de voix | vos mentions ÷ mentions de toutes les marques suivies × 100 | Poids concurrentiel |
| Taux de citation du domaine | réponses citant votre domaine ÷ réponses avec sources × 100 | Présence documentaire |
| Exactitude descriptive | descriptions exactes ÷ descriptions vérifiées × 100 | Qualité de votre image |
Neuf indicateurs et leurs dénominateurs. Aucun ne se lit seul.
Chaque indicateur est détaillé, avec son piège de lecture et sa cadence, dans les KPI du GEO ; la part de voix, son calcul et ses variantes dans Share of Voice IA : définition, calcul et limites.
Attention
Le rang moyen est trompeur seul : une marque citée une fois sur vingt mais toujours en première position affiche un « bon » rang. Lisez toujours le rang avec la fréquence. Et méfiez-vous des scores composites opaques : agréger moteurs, requêtes et jours dans un seul chiffre fait perdre l'essentiel, c'est-à-dire où, précisément, vous perdez des citations, et donc quoi corriger. Un score composite est acceptable avec une formule publiée, des poids déclarés, et les résultats bruts à côté.
Quelques indicateurs avancés éclairent la robustesse : la stabilité des réponses (variation entre répétitions, dans le temps, entre moteurs), la concentration des recommandations (combien de marques distinctes, domination d'un petit groupe), la fraîcheur des informations reprises (anciens prix, fonctions disparues) et, quand les citations sont visibles, la part de voix des sources : quels domaines et quels types de sources reviennent.
Quantifier l'incertitude
En bref
Un pourcentage seul est trompeur : 50 % sur deux observations et 50 % sur deux cents n'ont pas la même valeur. Toute fréquence issue d'un petit échantillon doit être accompagnée d'un intervalle d'incertitude et interprétée en tenant compte de la dépendance entre observations et des comparaisons multiples. C'est ce qui sépare une mesure d'un score rassurant.
- Publiez un taux et sa fourchette. Pour une proportion sur petit échantillon, préférez un intervalle adapté (l'intervalle de Wilson, par exemple) à l'intervalle normal naïf, qui se comporte mal près de 0 ou de 100 % et sur les petits effectifs.
- Tenez compte de la dépendance. Des relevés faits le même jour, avec la même question et la même version de modèle, ne sont pas indépendants ; les traiter comme tels surestime la précision.
- Méfiez-vous des comparaisons multiples. Sur des dizaines de requêtes et d'indicateurs, certains écarts apparaissent par hasard. Un écart isolé n'est pas un résultat.
- Distinguez détectable et important. Un changement statistiquement détectable peut n'avoir aucune portée commerciale, et n'est pas forcément attribuable à votre action.
Attention
Une idée répandue à corriger : « une variation sur trois ou quatre campagnes est significative ». C'est faux en général. La significativité dépend de la taille d'échantillon, de l'amplitude de l'effet, de la variance et du protocole, pas du nombre de campagnes.
Chaque moteur se mesure différemment
En bref
ChatGPT, Claude, Gemini, Perplexity, Copilot et les fonctions IA de Google n'offrent pas la même expérience : recherche web plus ou moins systématique, citations plus ou moins visibles, unité d'observation différente. Les Aperçus IA de Google se mesurent à l'échelle d'une requête Google, pas d'une conversation. Segmentez, et ne construisez jamais un score global sans conserver les sous-scores.
| Plateforme | Recherche web | Citations visibles | Unité de mesure | À surveiller |
|---|---|---|---|---|
| ChatGPT | Selon le mode | Selon le mode | Réponse conversationnelle | Distinguer réponse standard et recherche |
| Claude | Oui, quand l'outil de recherche est activé | Présentes, parcimonieuses | Réponse conversationnelle | Avec ou sans recherche |
| Gemini | Ancrage dans Google Search | Selon l'ancrage | Réponse conversationnelle | Proximité avec le classement Google |
| Perplexity | Systématique | Quasi systématiques | Réponse sourcée | Sources citées |
| Copilot | Index de Bing | Affichées | Réponse conversationnelle | Proximité avec Bing |
| Aperçus IA et AI Mode de Google | Index de Google | Liens affichés | Requête Google, déclenchée ou non | Géographie, appareil |
Comportements observables, vérifiés en septembre 2026 ; ils varient selon le pays, le plan et la version, et évoluent vite. Ce tableau ne décrit pas des mécanismes internes.
Un écart entre moteurs (visible sur Perplexity, absent de ChatGPT) est un signal de diagnostic, pas de la malchance : il pointe une différence de sources. Chaque moteur a son guide sur ce point : ChatGPT, Claude, Gemini, Perplexity, Google AI Mode, Microsoft Copilot. La cartographie des familles de sources est dans où les IA puisent leurs recommandations.
Le protocole Evocia, paramètre par paramètre
En bref
Le protocole des campagnes de mesure d'Evocia compte 20 requêtes réparties sur 6 secteurs de logiciels, figées avant la première observation, exécutées 10 fois chacune sur 5 moteurs (ChatGPT, Claude, Gemini, Perplexity, Copilot), en session neuve, en français depuis la France, soit 1 000 relevés par campagne. Ce qui est compté est une mention ; le score sur 100 pondère la fréquence par le rang moyen selon une formule publiée.
Les six secteurs suivis sont la relation client, les ressources humaines, la gestion et les ERP, la cybersécurité, les logiciels financiers et la legaltech, à raison de trois ou quatre requêtes par secteur. Chaque éditeur est mesuré sur les requêtes de son secteur, soit 30 à 40 relevés par moteur et 150 à 200 relevés au total. Les archives sont conservées vingt-quatre mois au format brut, et chaque campagne porte sa date.
Nous comptons une mention plutôt qu'une recommandation, et nous assumons ce choix : un programme détecte de façon fiable la présence d'un nom dans un texte, là où juger d'une recommandation exige une règle de codage et un annotateur humain. C'est possible dans un audit sur mesure ; cela ne se transpose pas à une mesure répétée à grande échelle. Nous préférons mesurer précisément une chose modeste plutôt qu'approximativement une chose ambitieuse. Le rang moyen accompagne la fréquence ; quand un éditeur n'est jamais nommé, il reste vide, jamais ramené à zéro.
VOLUME D'UNE CAMPAGNE
20 requêtes × 10 répétitions × 5 moteurs = 1 000 relevés
FRÉQUENCE DE CITATION (par moteur)
fréquence = relevés où l'éditeur est nommé ÷ relevés effectués × 100
SCORE DE VISIBILITÉ (sur 100, tous moteurs)
score = 100 × (relevés où l'éditeur est nommé, tous moteurs ÷ relevés effectués, tous moteurs) × p
p = 1 si le rang moyen est inférieur ou égal à 3
p = 0,8 si le rang moyen est compris entre 3 et 6
p = 0,6 si le rang moyen est supérieur à 6
Égalités : meilleur rang moyen, puis nombre de moteurs où l'éditeur est nommé, puis ex aequo.Une case vide n'est pas un zéro
Un zéro signifie que l'éditeur a été cherché sur les relevés effectués et n'y a jamais été nommé. Une case vide signifie qu'il n'a pas été mesuré sur ce moteur. Remplacer l'une par l'autre fabrique une information qui n'existe pas.
Un classement dont la méthode n'est pas publiée est un argument d'autorité. En publiant le panel, le nombre de répétitions, les définitions et la formule, nous acceptons que la mesure soit vérifiée, refaite et contestée. Cette exigence a un coût : elle expose nos arbitrages, qui sont discutables. Compter une mention plutôt qu'une recommandation en est un. Fixer le palier à trois en est un autre. Vingt requêtes, c'est peu. Nous préférons publier ces arbitrages plutôt que de laisser croire à une objectivité qui n'existerait pas. Aucun résultat d'éditeur n'est publié à ce jour : aucune campagne complète n'a encore été validée.
Lire un résultat sans le sur-interpréter
En bref
Une comparaison n'a de sens qu'à panel, période, moteurs et protocole identiques. Elle établit une fréquence observée et permet de suivre une évolution ; elle ne prédit aucune réponse individuelle, ne se généralise pas au-delà du panel et n'établit aucune cause. Trois glissements de formulation sont à s'interdire.
| Formulation à éviter | Formulation exacte |
|---|---|
| Cette marque est plus visible que celle-là | Cette marque a été nommée dans une part plus élevée des relevés du panel, sur la période mesurée |
| Cette marque est deux fois plus visible | Sa fréquence est le double de celle de l'autre sur ce panel, ce qui n'implique pas qu'un utilisateur la verra deux fois plus souvent |
| Cette marque domine son marché | La mesure porte sur des réponses générées, pas sur des parts de marché, dont elle ne dit rien |
| Cette marque est en tête grâce à son travail éditorial | La mesure établit une fréquence, elle n'en établit pas la cause |
Quatre corrections de formulation. La dernière est la plus fréquente et la plus coûteuse.
| La mesure permet | La mesure ne permet pas |
|---|---|
| De situer une marque par rapport à d'autres, à conditions identiques | De prévoir ce qu'un utilisateur obtiendra à un instant donné |
| De suivre une évolution d'une campagne à l'autre, panel inchangé | De généraliser à des requêtes absentes du panel |
| De constater un écart et d'en mesurer l'ampleur | D'attribuer une cause à cet écart |
| De documenter une période précise | D'affirmer que le résultat vaudra encore dans six mois |
Une mesure est une photographie datée. Une mise à jour de modèle ou d'index peut modifier des résultats stables depuis des semaines sans qu'aucune marque n'ait rien changé.
De la mesure à l'action, et la question de la causalité
En bref
La mesure n'a de valeur que si elle débouche sur des décisions. Chaque profil de résultat appelle une correction précise. Mais mesurer un changement ne prouve pas ce qui l'a causé : pour s'approcher d'une attribution, il faut des groupes de requêtes témoins, un déploiement progressif des actions et un journal daté des interventions.
| Constat | Cause probable | Action |
|---|---|---|
| Absent des requêtes de catégorie | Positionnement flou ou sources tierces faibles | Clarifier la catégorie, travailler les sources de la catégorie |
| Cité mais mal décrit | Sources obsolètes ou contradictoires | Corriger et dater les informations, chez vous et chez les tiers |
| Domaine jamais cité | Site peu récupérable ou peu citable | Rendre les pages accessibles et extractibles, publier des données originales |
| Visible sur un seul moteur | Sources différentes d'un moteur à l'autre | Analyser les sources du moteur où vous êtes absent |
| Concurrent dominant | Meilleure couverture documentaire | Analyse d'écart, requêtes de niche |
| Visibilité en hausse, pas de conversion | La visibilité n'est pas le revenu | Relier au pipeline, prioriser les requêtes transactionnelles |
Priorisez en croisant trois axes : la visibilité (êtes-vous vu ?), l'exactitude (êtes-vous bien décrit ?) et le potentiel commercial de la requête. Une forte visibilité avec une description fausse est plus urgente qu'une absence sur une requête sans enjeu.
- Groupes témoins : des familles de requêtes travaillées et d'autres non travaillées, sur la même période et le même protocole.
- Déploiement progressif : agir par lots pour observer l'effet, plutôt que tout changer d'un coup.
- Journal des interventions : dater chaque contenu publié, chaque modification, chaque mention obtenue, chaque mise à jour de profil.
La visibilité a progressé après les interventions, selon le protocole défini. Cela est compatible avec un effet des actions, sans exclure toutes les causes externes.
Mesure manuelle ou outil automatisé ?
En bref
Les deux ont leur place. La mesure manuelle offre une compréhension fine et coûte peu à démarrer, mais plafonne vite en volume et en reproductibilité. L'automatisation apporte volume, régularité et historique, mais une interface de programmation ne reproduit pas toujours l'interface grand public, et un score opaque ne remplace pas l'accès aux réponses brutes. Choisissez un outil sur sa transparence, pas sur sa promesse.
Les critères détaillés, l'arbitrage entre mesure manuelle et automatisée selon le volume, et les sources gratuites fournies par les éditeurs de moteurs sont dans outils de mesure de visibilité IA : comment choisir.
Vous voulez savoir où vous en êtes avant d'investir ? Evocia teste gratuitement trois requêtes de votre catégorie sur plusieurs moteurs et vous envoie une synthèse courte.
Tester ma visibilité IALes erreurs qui rendent une mesure inutilisable
En bref
La plupart des mesures ratées viennent de quelques erreurs récurrentes : ne tester que sa marque, ne tester qu'une fois, changer les formulations entre deux dates, mélanger les modes, oublier la date, confondre rang et fréquence, tirer une causalité d'un avant-après. Les repérer suffit à hausser fortement la qualité d'une mesure.
| Erreur | Pourquoi c'est un problème |
|---|---|
| Ne tester que sa marque | On ignore la concurrence et la catégorie |
| Tester une seule fois | Une réponse est un tirage, pas une fréquence |
| Modifier les formulations entre deux dates | Les campagnes ne sont plus comparables |
| Mélanger les modes (standard et recherche) | On agrège des choses différentes |
| Oublier la date et la langue | La variation temporelle et linguistique est ignorée |
| Confondre rang et fréquence | Un bon rang rare est mal interprété |
| Utiliser un score opaque | On ne peut ni vérifier ni corriger |
| Tirer une causalité d'un avant-après | D'autres facteurs ont pu bouger |
| Ne garder que les meilleures captures | Le résultat est biaisé |
| Changer l'échantillon entre campagnes | La comparaison est faussée |
| Publier sans méthodologie | Le résultat n'est pas vérifiable, donc pas crédible |
Onze erreurs. Chacune suffit, seule, à invalider une campagne.
Questions fréquentes
Comment savoir si ChatGPT recommande mon entreprise ?
En mesurant, pas en regardant un écran. Constituez un panel de questions d'achat de votre catégorie, répétez-les en sessions neuves, avec et sans recherche web, et relevez si votre marque est mentionnée, recommandée et à quel rang. La fréquence sur plusieurs relevés fait foi, pas une réponse isolée.
Combien de requêtes faut-il tester ?
Une dizaine à une vingtaine pour commencer, classées par intention et formulées comme vos acheteurs. Pour un pilotage fin, cinquante et plus, segmentées par marché. Le protocole Evocia en compte vingt sur six secteurs. L'important n'est pas le volume brut mais la représentativité des intentions et la stabilité du panel dans le temps.
Combien de fois faut-il répéter chaque requête ?
Cinq est un minimum opérationnel, pas une loi : cinq observations laissent une incertitude large, dix la réduisent modérément. Le protocole Evocia en fait dix, ce qui distingue une apparition occasionnelle d'une présence régulière mais ne départage pas un écart de quelques points entre deux marques proches. Accompagnez toujours un taux de son nombre d'observations.
Peut-on mesurer ChatGPT avec une seule capture d'écran ?
Non pour mesurer, oui pour documenter. Une capture datée conserve une preuve ou illustre une erreur, mais ne permet ni d'estimer une fréquence, ni de généraliser, ni de comparer deux périodes, ni d'attribuer une cause.
Pourquoi les réponses changent-elles d'une session à l'autre ?
La génération est probabiliste : à chaque tirage, plusieurs formulations sont en concurrence. S'y ajoutent le mode, la date, la fraîcheur des sources, la langue et la personnalisation. D'où la nécessité de répéter et de dater, plutôt que de conclure sur une réponse.
Faut-il utiliser un compte vierge ?
Autant que possible. OpenAI documente que la mémoire peut enrichir la requête envoyée à la recherche ; un compte habituel mesure son propre historique. Le protocole Evocia utilise la navigation privée, sans compte, mémoire désactivée. Quand la neutralisation n'est pas parfaite, documentez les conditions plutôt que de prétendre les avoir éliminées.
Sources
- OpenAI, ChatGPT Search (centre d'aide officiel : réécriture de la requête et rôle de la mémoire dans la recherche)
- OpenAI, documentation des robots (GPTBot, OAI-SearchBot, ChatGPT-User)
- Google Search Central, AI features and your website (éclatement de la requête en sous-recherches)
- Anthropic, outil de recherche web (citations et métadonnées des résultats)
- Perplexity, agents d'exploration et index propriétaire
- Hou et al., Large Language Models are Zero-Shot Rankers for Recommender Systems (biais de position), arXiv 2305.08845
- Liu, Zhang, Liang, Evaluating Verifiability in Generative Search Engines, EMNLP 2023, arXiv 2304.09848
Transparence et méthode
Auteur
Evocia · Cabinet français de visibilité dans les IA
Evocia est un cabinet français spécialisé dans la mesure et l'amélioration de la visibilité des entreprises dans les réponses des IA. Ce guide décrit la méthode générale de mesure et le protocole que le cabinet applique à ses propres campagnes, publié pour être vérifié.
Comment cet article a été réalisé
- Refonte éditoriale du 13 septembre 2026 : fusion de la méthode générale de mesure (publiée le 18 juillet 2026) et du protocole d'observation Evocia (publié le 17 août 2026), qui traitaient la même intention en deux articles. Aucune source retirée, aucune donnée ajoutée.
- Les paramètres du protocole Evocia (5 moteurs, 20 requêtes sur 6 secteurs, 10 répétitions, 1 000 relevés par campagne, formule du score) sont ceux inscrits dans le code du site, arrêtés le 17 août 2026. Les arbitrages (mention plutôt que recommandation, palier à trois, vingt requêtes) sont signalés comme des conventions Evocia, pas comme des facteurs des moteurs.
- Méthodes statistiques standard (intervalle de Wilson, prudence sur les petits échantillons, dépendance des observations, comparaisons multiples) présentées comme telles, sans fausse précision. Aucun paramètre interne des produits grand public n'est présenté comme connu.
- Aucun résultat d'éditeur n'est publié : aucune campagne publique complète n'a encore été validée. Fonctionnalités des moteurs vérifiées en septembre 2026 ; elles évoluent, datez toujours vos mesures.
Historique des mises à jour
- 14 septembre 2026Renvoi vers l'étude Evocia AI Sources Index 2026 (mesure du 14 septembre 2026) ajouté.
- 13 septembre 2026Seconde passe : section d'exécution resserrée à un paragraphe par règle.
- 13 septembre 2026Raccourci de 23 à une vingtaine de minutes : la section sur les outils est ramenée à un renvoi vers le guide dédié, la liste des critères de choix d'un outil retirée, FAQ ramenée à six questions.
- 13 septembre 2026Fusion avec « Comment mesurer une visibilité qui varie » : le protocole Evocia (paramètres, définitions, formule du score, règles de comparaison) devient une section de ce guide, qui devient le pilier du cluster Mesure sous une nouvelle adresse. Les deux anciennes adresses redirigent. Section sur les moteurs élargie à Copilot, FAQ recomposée.
- 12 septembre 2026Réduction éditoriale : retrait de l'exemple de calcul, du tableau de bord et du dictionnaire de données.
- 17 août 2026Publication du protocole d'observation Evocia dans un article distinct, désormais fusionné ici.
- 26 juillet 2026Refonte en méthode de référence : taxonomie de la visibilité, sources de variation, protocole complet, métriques, incertitude, comparatif des moteurs, causalité.
- 18 juillet 2026Publication initiale : le protocole de mesure en trois exigences (requêtes figées, répétitions, archivage).