Aller au contenu
Evocia
Toutes les ressources

Mesure

Comment mesurer sa visibilité dans ChatGPT et les IA

Par Evocia18 juillet 2026· Mis à jour le 14 septembre 2026· 22 min de lecture

Partager

Mesurer sa visibilité dans les IA ne consiste pas à poser quelques questions à ChatGPT et à conserver des captures d'écran. Une même question, posée deux fois, peut donner deux réponses différentes : la génération est probabiliste, et le résultat dépend du moteur, du mode (avec ou sans recherche web), du compte, de la langue et du moment. Une observation isolée documente un cas ; elle ne mesure rien.

Ce guide donne la méthode complète : ce que l'on mesure exactement, comment construire un panel de requêtes, combien de fois les répéter, quels indicateurs calculer, comment lire un résultat sans le sur-interpréter, et comment passer de la mesure à l'action. Il décrit aussi, paramètre par paramètre, le protocole qu'Evocia applique à ses propres campagnes, publié pour être vérifié et critiqué.

L'essentiel en 60 secondes

  • La visibilité dans les IA est une fréquence, jamais un état : la part des relevés où une marque est nommée, sur un panel de requêtes figé, répété dans des conditions constantes et datées.
  • Mention, recommandation, citation d'une source et lien vers un domaine sont quatre variables différentes. Les confondre fausse toute analyse.
  • Le panel de requêtes se construit avant la mesure, à partir des questions réelles des acheteurs, segmenté par intention, et ne change plus d'une campagne à l'autre.
  • Cinq répétitions par requête sont un minimum opérationnel ; le protocole Evocia en fait dix, sur cinq moteurs, en session neuve. Un taux se publie toujours avec son nombre d'observations.
  • Un tableau de bord combine plusieurs indicateurs (mention, recommandation, rang, part de voix, citation du domaine, exactitude), jamais un score unique et opaque.
  • Chaque moteur se mesure séparément : ChatGPT, Claude, Gemini, Perplexity, Copilot et les fonctions IA de Google n'ont ni les mêmes sources ni la même unité d'observation.
  • Une évolution mesurée n'est pas une preuve de causalité : groupes de requêtes témoins, journal des actions et formulation au conditionnel sont indispensables.
  • Le protocole Evocia est public : 20 requêtes sur 6 secteurs, 10 répétitions, 5 moteurs, 1 000 relevés par campagne, formule du score reproductible à la main. Aucun résultat n'est publié avant qu'une campagne complète ait été validée.

Qu'est-ce que la visibilité dans les IA ?

En bref

La visibilité dans les IA désigne la fréquence, la position, le contexte et l'exactitude avec lesquels une marque, un produit ou son contenu apparaît dans les réponses générées, pour un ensemble défini de requêtes, de moteurs, de modes, de langues et de dates. C'est une définition opérationnelle, pensée pour être reproductible, pas une norme officielle.

Quatre variables se cachent derrière le mot « visible », et elles ne se recouvrent pas. Une mention nomme la marque. Une recommandation la présente comme une option adaptée au besoin. Une citation rattache la réponse à une source, souvent avec un lien. Un lien vers le domaine pointe vers votre site. On peut être mentionné sans être recommandé, cité via une page tierce sans que votre site soit la source, ou recommandé sans aucune citation visible. Interpréter ces écarts renvoie aux causes analysées dans pourquoi votre entreprise est invisible dans les réponses des IA.

VariableCe qu'elle indiqueExemple
MentionLa marque est nommée« Parmi les options : Marque X »
RecommandationLa marque est conseillée pour le besoin« Pour ce cas, Marque X convient bien »
Citation d'une sourceLa réponse s'appuie sur une source identifiéeUne fiche d'avis citée en référence
Lien vers le domaineUn lien pointe vers votre siteLien cliquable vers votre page

Quatre variables, quatre dénominateurs. Un taux de citation du domaine, par exemple, ne se calcule que sur les réponses qui affichent des sources.

DimensionQuestionIndicateur type
MarqueÊtes-vous mentionné ?Taux de mention
RecommandationÊtes-vous conseillé ?Taux de recommandation
PositionÀ quel rang ?Rang moyen, présence dans les trois premiers
ThématiqueSur quels besoins ?Couverture par intention
DocumentaireVotre domaine est-il cité ?Taux de citation du domaine
DescriptiveComment êtes-vous décrit ?Exactitude descriptive
ConcurrentielleQuelle part de l'espace ?Part de voix
TransactionnelleSur les requêtes d'achat ?Présence par étape du parcours

Les dimensions de la visibilité. Aucune ne résume les autres ; un tableau de bord en combine plusieurs.

Étude Evocia : AI Sources Index 2026

Ce que donne le protocole appliqué à un marché entier, mesure Evocia du 14 septembre 2026 sur ChatGPT (API avec recherche web, 200 requêtes B2B × 4 répétitions) : 38,3 % des paires requête × domaine n'apparaissent que dans une réponse sur quatre, 27,1 % dans les quatre, et seules 13 % des requêtes donnent quatre fois le même ensemble de sources. C'est la raison de la mesure en fréquence. Graphiques et données : Evocia AI Sources Index 2026.

Pourquoi une seule réponse ne mesure rien

En bref

Parce que la génération est probabiliste et que le résultat dépend de la formulation, du compte, du moteur, du mode et du moment. Deux observations séparées de quelques minutes peuvent différer sans qu'aucune action de l'entreprise observée n'en soit la cause. On ne conclut donc pas sur une réponse : on échantillonne, à conditions documentées et constantes, et on consigne une fréquence.

Source de variationExempleÀ faire
Génération probabilisteDeux tirages, deux formulations, deux listesRépéter, agréger
Formulation de la question« meilleur X » et « X pour une PME » ne donnent pas la même réponseFiger et versionner les formulations
Compte et personnalisationHistorique, mémoire, langue du profilSession neuve, conditions documentées
Moteur, modèle, modeRéponse standard ou avec recherche webSegmenter, ne jamais mélanger
MomentActualité, mise à jour du modèle ou de l'indexDater chaque relevé

Cinq sources de variation qui se combinent. Aucune ne s'élimine ; toutes se documentent.

Une capture d'écran reste utile : elle documente une réponse datée, conserve une preuve, illustre une erreur. Ce qu'elle ne permet pas, c'est l'inférence : estimer une probabilité d'apparition, généraliser à tous les utilisateurs, comparer deux périodes, attribuer une cause à un changement. Le problème n'est jamais la capture, c'est ce qu'on lui fait dire.

Le critère qui départage une mesure d'une impression

Une mesure est reproductible : un tiers disposant du panel de requêtes, du nombre de répétitions et des conditions de test doit pouvoir refaire le travail et obtenir des résultats comparables. C'est la seule raison pour laquelle Evocia publie ses paramètres plutôt que de les garder pour elle.

Construire le panel de requêtes

En bref

Un protocole commence par trois décisions : l'objectif de la mesure (état des lieux, benchmark, suivi d'actions, contrôle de réputation), le périmètre (pays, langue, moteurs, modes, concurrents, période) et le panel de requêtes, segmenté par intention et figé avant toute mesure. Un panel modifié en cours de route produit une mesure qui reflète le choix des questions autant que la réalité observée.

Les requêtes doivent refléter les questions réelles de vos acheteurs, formulées comme ils les posent et non comme des mots-clés de référencement. Puisez-les dans les entretiens clients, les appels commerciaux, les tickets de support, la Search Console, les appels d'offres et les forums. Segmentez-les par intention : catégorie, besoin métier, secteur, taille d'entreprise, fonctionnalité, comparaison, alternative, contrainte, prix, requête de marque.

FamilleIntentionÉtape du parcoursExemple
CatégorieDécouverteHaut« Meilleurs logiciels RH pour une PME française »
Cas d'usageConsidérationMilieu« Outil de signature électronique conforme pour un grand compte »
ComparaisonConsidérationMilieu« Alternatives à [concurrent] pour 500 salariés »
ContrainteDécisionBas« Logiciel RH avec authentification unique et hébergement européen »
MarqueRéputationTransverse« Que vaut [votre marque] ? »

Cinq familles de requêtes. Les requêtes de marque se mesurent à part : mélangées aux requêtes de catégorie, elles gonflent artificiellement la visibilité.

Attention

Si vous pondérez certaines requêtes (les transactionnelles, par exemple), fixez la pondération avant l'analyse et conservez les résultats bruts à côté du score pondéré. Une pondération décidée après coup est une façon de choisir son résultat.

Exécuter : conditions, répétitions, archivage

En bref

L'exécution obéit à cinq règles : figer et versionner les formulations, documenter les conditions de session, répéter chaque requête, archiver les réponses brutes, annoter selon un guide stable. Sans ces règles, deux campagnes ne sont pas comparables.

Figer les formulations et documenter la session

Chaque question reçoit un identifiant et une version. Ponctuation, langue, longueur, demande de sources, nombre de recommandations demandées : tout est fixé. Pour chaque relevé, enregistrez le moteur, le modèle affiché, le mode (avec ou sans recherche), la date et l'heure, le pays, la langue, l'appareil, le statut connecté ou non, la mémoire activée ou non, et un identifiant d'exécution.

Exécuter en session neuve

Documenté officiellement

OpenAI documente que, lorsque la mémoire d'un utilisateur est activée, elle peut enrichir la requête effectivement envoyée aux systèmes de recherche. Un relevé effectué depuis un compte professionnel qui a discuté cent fois d'un produit ne mesure donc pas la visibilité de ce produit, mais l'historique de ce compte. D'où la règle : navigation privée, sans compte connecté, mémoire et personnalisation désactivées quand l'option existe, sans historique de conversation.

La langue et la localisation se fixent pour la même raison : elles modifient les sources que les moteurs mobilisent. Une mesure conduite en anglais depuis un autre pays observe un autre écosystème de sources. Une réponse constitue une observation : une marque nommée plusieurs fois dans la même réponse compte une seule fois, et le rang retenu est celui de sa première apparition. Sans cette règle, une réponse bavarde produirait mécaniquement un meilleur résultat qu'une réponse concise.

Répéter, sans seuil magique

Cinq répétitions par requête sont un minimum opérationnel, pas une loi. Cinq observations laissent une incertitude large, dix la réduisent modérément. Le bon nombre dépend de la précision recherchée et du budget : il faut arbitrer entre couvrir plus de requêtes et répéter davantage. Pour mesurer une stabilité, répartissez les relevés sur des jours et des heures différents.

NiveauUsageRequêtesRépétitionsLimite
ExploratoireDétecter des tendances10 à 203 à 5Non généralisable
StandardTableau de bord régulier20 à 505 à 10, réparties dans le tempsIncertitude encore notable
RenforcéÉtude publiable50 et plus10 et plus, répartiesCoût et temps d'annotation

Repères opérationnels Evocia, pas des standards scientifiques.

Archiver et annoter

Conservez le texte complet de chaque réponse, les liens et citations, la date, la question exacte, le moteur, le mode et un identifiant unique, dans un format réanalysable. Puis annotez selon un guide écrit : marque citée et ses variantes, rang, présence dans les trois premiers, recommandation explicite, exactitude de la description, lien vers le domaine, sources citées, concurrents présents. Contrôlez la qualité par une double annotation sur un sous-échantillon. L'archive est ce qui permet, si la définition d'un indicateur est affinée, de recalculer la série entière sans refaire les relevés.

Les indicateurs à suivre

En bref

Un tableau de bord minimal combine plusieurs indicateurs, jamais un seul : taux de mention, taux de recommandation, présence dans les trois premiers, rang moyen conditionnel, couverture des requêtes et des moteurs, part de voix, taux de citation du domaine, exactitude descriptive. Chaque indicateur n'a de sens que si son dénominateur et ses conditions sont déclarés.

IndicateurFormuleLecture
Taux de mentionréponses nommant la marque ÷ réponses éligibles × 100Probabilité d'apparaître
Taux de recommandationréponses la recommandant ÷ réponses éligibles × 100Présence qualifiée
Présence dans les trois premiersréponses où la marque est dans les trois premiers noms ÷ réponses × 100Visibilité forte
Rang moyen conditionnelmoyenne du rang quand la marque apparaîtÀ lire avec la fréquence
Couverture des requêtesrequêtes où la marque apparaît au moins une fois ÷ requêtes × 100Étendue de la présence
Couverture des moteursmoteurs où la marque apparaît ÷ moteurs testésPrésence multi-moteurs
Part de voixvos mentions ÷ mentions de toutes les marques suivies × 100Poids concurrentiel
Taux de citation du domaineréponses citant votre domaine ÷ réponses avec sources × 100Présence documentaire
Exactitude descriptivedescriptions exactes ÷ descriptions vérifiées × 100Qualité de votre image

Neuf indicateurs et leurs dénominateurs. Aucun ne se lit seul.

Chaque indicateur est détaillé, avec son piège de lecture et sa cadence, dans les KPI du GEO ; la part de voix, son calcul et ses variantes dans Share of Voice IA : définition, calcul et limites.

Attention

Le rang moyen est trompeur seul : une marque citée une fois sur vingt mais toujours en première position affiche un « bon » rang. Lisez toujours le rang avec la fréquence. Et méfiez-vous des scores composites opaques : agréger moteurs, requêtes et jours dans un seul chiffre fait perdre l'essentiel, c'est-à-dire où, précisément, vous perdez des citations, et donc quoi corriger. Un score composite est acceptable avec une formule publiée, des poids déclarés, et les résultats bruts à côté.

Quelques indicateurs avancés éclairent la robustesse : la stabilité des réponses (variation entre répétitions, dans le temps, entre moteurs), la concentration des recommandations (combien de marques distinctes, domination d'un petit groupe), la fraîcheur des informations reprises (anciens prix, fonctions disparues) et, quand les citations sont visibles, la part de voix des sources : quels domaines et quels types de sources reviennent.

Quantifier l'incertitude

En bref

Un pourcentage seul est trompeur : 50 % sur deux observations et 50 % sur deux cents n'ont pas la même valeur. Toute fréquence issue d'un petit échantillon doit être accompagnée d'un intervalle d'incertitude et interprétée en tenant compte de la dépendance entre observations et des comparaisons multiples. C'est ce qui sépare une mesure d'un score rassurant.

  • Publiez un taux et sa fourchette. Pour une proportion sur petit échantillon, préférez un intervalle adapté (l'intervalle de Wilson, par exemple) à l'intervalle normal naïf, qui se comporte mal près de 0 ou de 100 % et sur les petits effectifs.
  • Tenez compte de la dépendance. Des relevés faits le même jour, avec la même question et la même version de modèle, ne sont pas indépendants ; les traiter comme tels surestime la précision.
  • Méfiez-vous des comparaisons multiples. Sur des dizaines de requêtes et d'indicateurs, certains écarts apparaissent par hasard. Un écart isolé n'est pas un résultat.
  • Distinguez détectable et important. Un changement statistiquement détectable peut n'avoir aucune portée commerciale, et n'est pas forcément attribuable à votre action.

Attention

Une idée répandue à corriger : « une variation sur trois ou quatre campagnes est significative ». C'est faux en général. La significativité dépend de la taille d'échantillon, de l'amplitude de l'effet, de la variance et du protocole, pas du nombre de campagnes.

Chaque moteur se mesure différemment

En bref

ChatGPT, Claude, Gemini, Perplexity, Copilot et les fonctions IA de Google n'offrent pas la même expérience : recherche web plus ou moins systématique, citations plus ou moins visibles, unité d'observation différente. Les Aperçus IA de Google se mesurent à l'échelle d'une requête Google, pas d'une conversation. Segmentez, et ne construisez jamais un score global sans conserver les sous-scores.

PlateformeRecherche webCitations visiblesUnité de mesureÀ surveiller
ChatGPTSelon le modeSelon le modeRéponse conversationnelleDistinguer réponse standard et recherche
ClaudeOui, quand l'outil de recherche est activéPrésentes, parcimonieusesRéponse conversationnelleAvec ou sans recherche
GeminiAncrage dans Google SearchSelon l'ancrageRéponse conversationnelleProximité avec le classement Google
PerplexitySystématiqueQuasi systématiquesRéponse sourcéeSources citées
CopilotIndex de BingAffichéesRéponse conversationnelleProximité avec Bing
Aperçus IA et AI Mode de GoogleIndex de GoogleLiens affichésRequête Google, déclenchée ou nonGéographie, appareil

Comportements observables, vérifiés en septembre 2026 ; ils varient selon le pays, le plan et la version, et évoluent vite. Ce tableau ne décrit pas des mécanismes internes.

Un écart entre moteurs (visible sur Perplexity, absent de ChatGPT) est un signal de diagnostic, pas de la malchance : il pointe une différence de sources. Chaque moteur a son guide sur ce point : ChatGPT, Claude, Gemini, Perplexity, Google AI Mode, Microsoft Copilot. La cartographie des familles de sources est dans où les IA puisent leurs recommandations.

Le protocole Evocia, paramètre par paramètre

En bref

Le protocole des campagnes de mesure d'Evocia compte 20 requêtes réparties sur 6 secteurs de logiciels, figées avant la première observation, exécutées 10 fois chacune sur 5 moteurs (ChatGPT, Claude, Gemini, Perplexity, Copilot), en session neuve, en français depuis la France, soit 1 000 relevés par campagne. Ce qui est compté est une mention ; le score sur 100 pondère la fréquence par le rang moyen selon une formule publiée.

Les six secteurs suivis sont la relation client, les ressources humaines, la gestion et les ERP, la cybersécurité, les logiciels financiers et la legaltech, à raison de trois ou quatre requêtes par secteur. Chaque éditeur est mesuré sur les requêtes de son secteur, soit 30 à 40 relevés par moteur et 150 à 200 relevés au total. Les archives sont conservées vingt-quatre mois au format brut, et chaque campagne porte sa date.

Nous comptons une mention plutôt qu'une recommandation, et nous assumons ce choix : un programme détecte de façon fiable la présence d'un nom dans un texte, là où juger d'une recommandation exige une règle de codage et un annotateur humain. C'est possible dans un audit sur mesure ; cela ne se transpose pas à une mesure répétée à grande échelle. Nous préférons mesurer précisément une chose modeste plutôt qu'approximativement une chose ambitieuse. Le rang moyen accompagne la fréquence ; quand un éditeur n'est jamais nommé, il reste vide, jamais ramené à zéro.

VOLUME D'UNE CAMPAGNE

  20 requêtes  ×  10 répétitions  ×  5 moteurs  =  1 000 relevés

FRÉQUENCE DE CITATION (par moteur)

  fréquence = relevés où l'éditeur est nommé ÷ relevés effectués × 100

SCORE DE VISIBILITÉ (sur 100, tous moteurs)

  score = 100 × (relevés où l'éditeur est nommé, tous moteurs ÷ relevés effectués, tous moteurs) × p

  p = 1     si le rang moyen est inférieur ou égal à 3
  p = 0,8   si le rang moyen est compris entre 3 et 6
  p = 0,6   si le rang moyen est supérieur à 6

  Égalités : meilleur rang moyen, puis nombre de moteurs où l'éditeur est nommé, puis ex aequo.
Le protocole en chiffres et la formule du score, reproductibles à la main. Le palier à trois traduit un fait d'usage : les listes que retiennent les acheteurs comptent trois noms ou moins.

Une case vide n'est pas un zéro

Un zéro signifie que l'éditeur a été cherché sur les relevés effectués et n'y a jamais été nommé. Une case vide signifie qu'il n'a pas été mesuré sur ce moteur. Remplacer l'une par l'autre fabrique une information qui n'existe pas.

Un classement dont la méthode n'est pas publiée est un argument d'autorité. En publiant le panel, le nombre de répétitions, les définitions et la formule, nous acceptons que la mesure soit vérifiée, refaite et contestée. Cette exigence a un coût : elle expose nos arbitrages, qui sont discutables. Compter une mention plutôt qu'une recommandation en est un. Fixer le palier à trois en est un autre. Vingt requêtes, c'est peu. Nous préférons publier ces arbitrages plutôt que de laisser croire à une objectivité qui n'existerait pas. Aucun résultat d'éditeur n'est publié à ce jour : aucune campagne complète n'a encore été validée.

Lire un résultat sans le sur-interpréter

En bref

Une comparaison n'a de sens qu'à panel, période, moteurs et protocole identiques. Elle établit une fréquence observée et permet de suivre une évolution ; elle ne prédit aucune réponse individuelle, ne se généralise pas au-delà du panel et n'établit aucune cause. Trois glissements de formulation sont à s'interdire.

Formulation à éviterFormulation exacte
Cette marque est plus visible que celle-làCette marque a été nommée dans une part plus élevée des relevés du panel, sur la période mesurée
Cette marque est deux fois plus visibleSa fréquence est le double de celle de l'autre sur ce panel, ce qui n'implique pas qu'un utilisateur la verra deux fois plus souvent
Cette marque domine son marchéLa mesure porte sur des réponses générées, pas sur des parts de marché, dont elle ne dit rien
Cette marque est en tête grâce à son travail éditorialLa mesure établit une fréquence, elle n'en établit pas la cause

Quatre corrections de formulation. La dernière est la plus fréquente et la plus coûteuse.

La mesure permetLa mesure ne permet pas
De situer une marque par rapport à d'autres, à conditions identiquesDe prévoir ce qu'un utilisateur obtiendra à un instant donné
De suivre une évolution d'une campagne à l'autre, panel inchangéDe généraliser à des requêtes absentes du panel
De constater un écart et d'en mesurer l'ampleurD'attribuer une cause à cet écart
De documenter une période préciseD'affirmer que le résultat vaudra encore dans six mois

Une mesure est une photographie datée. Une mise à jour de modèle ou d'index peut modifier des résultats stables depuis des semaines sans qu'aucune marque n'ait rien changé.

De la mesure à l'action, et la question de la causalité

En bref

La mesure n'a de valeur que si elle débouche sur des décisions. Chaque profil de résultat appelle une correction précise. Mais mesurer un changement ne prouve pas ce qui l'a causé : pour s'approcher d'une attribution, il faut des groupes de requêtes témoins, un déploiement progressif des actions et un journal daté des interventions.

ConstatCause probableAction
Absent des requêtes de catégoriePositionnement flou ou sources tierces faiblesClarifier la catégorie, travailler les sources de la catégorie
Cité mais mal décritSources obsolètes ou contradictoiresCorriger et dater les informations, chez vous et chez les tiers
Domaine jamais citéSite peu récupérable ou peu citableRendre les pages accessibles et extractibles, publier des données originales
Visible sur un seul moteurSources différentes d'un moteur à l'autreAnalyser les sources du moteur où vous êtes absent
Concurrent dominantMeilleure couverture documentaireAnalyse d'écart, requêtes de niche
Visibilité en hausse, pas de conversionLa visibilité n'est pas le revenuRelier au pipeline, prioriser les requêtes transactionnelles

Priorisez en croisant trois axes : la visibilité (êtes-vous vu ?), l'exactitude (êtes-vous bien décrit ?) et le potentiel commercial de la requête. Une forte visibilité avec une description fausse est plus urgente qu'une absence sur une requête sans enjeu.

  • Groupes témoins : des familles de requêtes travaillées et d'autres non travaillées, sur la même période et le même protocole.
  • Déploiement progressif : agir par lots pour observer l'effet, plutôt que tout changer d'un coup.
  • Journal des interventions : dater chaque contenu publié, chaque modification, chaque mention obtenue, chaque mise à jour de profil.
La visibilité a progressé après les interventions, selon le protocole défini. Cela est compatible avec un effet des actions, sans exclure toutes les causes externes.

Mesure manuelle ou outil automatisé ?

En bref

Les deux ont leur place. La mesure manuelle offre une compréhension fine et coûte peu à démarrer, mais plafonne vite en volume et en reproductibilité. L'automatisation apporte volume, régularité et historique, mais une interface de programmation ne reproduit pas toujours l'interface grand public, et un score opaque ne remplace pas l'accès aux réponses brutes. Choisissez un outil sur sa transparence, pas sur sa promesse.

Les critères détaillés, l'arbitrage entre mesure manuelle et automatisée selon le volume, et les sources gratuites fournies par les éditeurs de moteurs sont dans outils de mesure de visibilité IA : comment choisir.

Vous voulez savoir où vous en êtes avant d'investir ? Evocia teste gratuitement trois requêtes de votre catégorie sur plusieurs moteurs et vous envoie une synthèse courte.

Tester ma visibilité IA

Les erreurs qui rendent une mesure inutilisable

En bref

La plupart des mesures ratées viennent de quelques erreurs récurrentes : ne tester que sa marque, ne tester qu'une fois, changer les formulations entre deux dates, mélanger les modes, oublier la date, confondre rang et fréquence, tirer une causalité d'un avant-après. Les repérer suffit à hausser fortement la qualité d'une mesure.

ErreurPourquoi c'est un problème
Ne tester que sa marqueOn ignore la concurrence et la catégorie
Tester une seule foisUne réponse est un tirage, pas une fréquence
Modifier les formulations entre deux datesLes campagnes ne sont plus comparables
Mélanger les modes (standard et recherche)On agrège des choses différentes
Oublier la date et la langueLa variation temporelle et linguistique est ignorée
Confondre rang et fréquenceUn bon rang rare est mal interprété
Utiliser un score opaqueOn ne peut ni vérifier ni corriger
Tirer une causalité d'un avant-aprèsD'autres facteurs ont pu bouger
Ne garder que les meilleures capturesLe résultat est biaisé
Changer l'échantillon entre campagnesLa comparaison est faussée
Publier sans méthodologieLe résultat n'est pas vérifiable, donc pas crédible

Onze erreurs. Chacune suffit, seule, à invalider une campagne.

Questions fréquentes

Comment savoir si ChatGPT recommande mon entreprise ?

En mesurant, pas en regardant un écran. Constituez un panel de questions d'achat de votre catégorie, répétez-les en sessions neuves, avec et sans recherche web, et relevez si votre marque est mentionnée, recommandée et à quel rang. La fréquence sur plusieurs relevés fait foi, pas une réponse isolée.

Combien de requêtes faut-il tester ?

Une dizaine à une vingtaine pour commencer, classées par intention et formulées comme vos acheteurs. Pour un pilotage fin, cinquante et plus, segmentées par marché. Le protocole Evocia en compte vingt sur six secteurs. L'important n'est pas le volume brut mais la représentativité des intentions et la stabilité du panel dans le temps.

Combien de fois faut-il répéter chaque requête ?

Cinq est un minimum opérationnel, pas une loi : cinq observations laissent une incertitude large, dix la réduisent modérément. Le protocole Evocia en fait dix, ce qui distingue une apparition occasionnelle d'une présence régulière mais ne départage pas un écart de quelques points entre deux marques proches. Accompagnez toujours un taux de son nombre d'observations.

Peut-on mesurer ChatGPT avec une seule capture d'écran ?

Non pour mesurer, oui pour documenter. Une capture datée conserve une preuve ou illustre une erreur, mais ne permet ni d'estimer une fréquence, ni de généraliser, ni de comparer deux périodes, ni d'attribuer une cause.

Pourquoi les réponses changent-elles d'une session à l'autre ?

La génération est probabiliste : à chaque tirage, plusieurs formulations sont en concurrence. S'y ajoutent le mode, la date, la fraîcheur des sources, la langue et la personnalisation. D'où la nécessité de répéter et de dater, plutôt que de conclure sur une réponse.

Faut-il utiliser un compte vierge ?

Autant que possible. OpenAI documente que la mémoire peut enrichir la requête envoyée à la recherche ; un compte habituel mesure son propre historique. Le protocole Evocia utilise la navigation privée, sans compte, mémoire désactivée. Quand la neutralisation n'est pas parfaite, documentez les conditions plutôt que de prétendre les avoir éliminées.

Sources

Transparence et méthode

Auteur

Evocia · Cabinet français de visibilité dans les IA

Evocia est un cabinet français spécialisé dans la mesure et l'amélioration de la visibilité des entreprises dans les réponses des IA. Ce guide décrit la méthode générale de mesure et le protocole que le cabinet applique à ses propres campagnes, publié pour être vérifié.

Comment cet article a été réalisé

  • Refonte éditoriale du 13 septembre 2026 : fusion de la méthode générale de mesure (publiée le 18 juillet 2026) et du protocole d'observation Evocia (publié le 17 août 2026), qui traitaient la même intention en deux articles. Aucune source retirée, aucune donnée ajoutée.
  • Les paramètres du protocole Evocia (5 moteurs, 20 requêtes sur 6 secteurs, 10 répétitions, 1 000 relevés par campagne, formule du score) sont ceux inscrits dans le code du site, arrêtés le 17 août 2026. Les arbitrages (mention plutôt que recommandation, palier à trois, vingt requêtes) sont signalés comme des conventions Evocia, pas comme des facteurs des moteurs.
  • Méthodes statistiques standard (intervalle de Wilson, prudence sur les petits échantillons, dépendance des observations, comparaisons multiples) présentées comme telles, sans fausse précision. Aucun paramètre interne des produits grand public n'est présenté comme connu.
  • Aucun résultat d'éditeur n'est publié : aucune campagne publique complète n'a encore été validée. Fonctionnalités des moteurs vérifiées en septembre 2026 ; elles évoluent, datez toujours vos mesures.

Historique des mises à jour

  • 14 septembre 2026Renvoi vers l'étude Evocia AI Sources Index 2026 (mesure du 14 septembre 2026) ajouté.
  • 13 septembre 2026Seconde passe : section d'exécution resserrée à un paragraphe par règle.
  • 13 septembre 2026Raccourci de 23 à une vingtaine de minutes : la section sur les outils est ramenée à un renvoi vers le guide dédié, la liste des critères de choix d'un outil retirée, FAQ ramenée à six questions.
  • 13 septembre 2026Fusion avec « Comment mesurer une visibilité qui varie » : le protocole Evocia (paramètres, définitions, formule du score, règles de comparaison) devient une section de ce guide, qui devient le pilier du cluster Mesure sous une nouvelle adresse. Les deux anciennes adresses redirigent. Section sur les moteurs élargie à Copilot, FAQ recomposée.
  • 12 septembre 2026Réduction éditoriale : retrait de l'exemple de calcul, du tableau de bord et du dictionnaire de données.
  • 17 août 2026Publication du protocole d'observation Evocia dans un article distinct, désormais fusionné ici.
  • 26 juillet 2026Refonte en méthode de référence : taxonomie de la visibilité, sources de variation, protocole complet, métriques, incertitude, comparatif des moteurs, causalité.
  • 18 juillet 2026Publication initiale : le protocole de mesure en trois exigences (requêtes figées, répétitions, archivage).

À lire aussi

Commencez par le test gratuit : 3 requêtes, une synthèse claire.

Sans engagement · Nombre limité d'analyses gratuites chaque semaine

Tester ma visibilité IA