Études
Mesurer sa visibilité dans ChatGPT, Claude et Gemini : la méthode
Réponse directe : mesurer sa visibilité dans les IA ne consiste pas à poser quelques questions et à enregistrer des captures d'écran. Il faut construire un protocole reproductible, documenter les conditions de test, répéter les observations, séparer plusieurs dimensions de visibilité, et interpréter les résultats avec l'incertitude qui convient.
Pourquoi tant de rigueur ? Parce qu'une même question, posée deux fois, peut donner deux réponses différentes : la génération est probabiliste, et le résultat dépend du moteur, du mode (avec ou sans recherche web), du compte, de la langue et du moment. Une observation isolée documente un cas ; elle ne mesure pas une visibilité stable. Les mécanismes qui font varier ces réponses sont détaillés dans comment une IA choisit les logiciels qu'elle recommande.
Ce guide fournit une méthode complète : ce que l'on mesure exactement, comment construire un panel de requêtes, combien de répétitions, comment archiver et annoter, quelles métriques calculer, comment quantifier l'incertitude, comment comparer les moteurs, et comment passer de la mesure à l'action, sans jamais confondre corrélation et causalité. Le plan d'action lui-même est détaillé dans le guide GEO pour les SaaS B2B.
Une précision : « visibilité dans les IA » n'est pas encore un standard officiel. La définition employée ici est opérationnelle, pensée pour être reproductible. Fonctionnalités des moteurs vérifiées en juillet 2026 ; elles évoluent, datez toujours vos mesures.
L'essentiel en 60 secondes
- Une observation isolée documente un cas, mais ne permet pas d'estimer une visibilité stable ni une évolution : le problème est l'inférence, pas la capture.
- Le panel de requêtes se définit AVANT la mesure, se fige, et se compare toujours à conditions constantes.
- La fréquence compte, mais elle ne suffit pas : mesurez aussi présence, rang, part de voix, exactitude, sources et couverture par moteur.
- Les moteurs et les modes (standard, recherche web) ne se mélangent pas : segmentez avant d'agréger.
- Distinguez la mention d'une marque, sa recommandation, et la citation de son domaine : ce sont des variables différentes.
- Cinq répétitions est un minimum opérationnel, pas une loi : accompagnez tout taux d'un intervalle d'incertitude.
- Une évolution mesurée n'est pas une preuve de causalité : il faut des groupes témoins, un journal des actions et de la prudence.
- Conservez les réponses brutes, datées : c'est ce qui rend une mesure vérifiable, donc sérieuse.
Qu'appelle-t-on « visibilité dans les IA » ?
En bref
La visibilité dans les IA désigne la fréquence, la position, le contexte et la qualité avec lesquels une marque, un produit ou son contenu apparaît dans les réponses générées, pour un ensemble défini de requêtes. C'est une définition opérationnelle, pas une norme officielle. Elle recouvre plusieurs dimensions distinctes qu'il faut mesurer séparément.
Définition
La visibilité dans les IA est la fréquence, la position, le contexte et la qualité avec lesquels une marque, un produit ou son contenu apparaît dans les réponses générées pour un ensemble défini de requêtes, de moteurs, de modes, de langues et de dates.
Mention, recommandation, citation, lien : quatre choses différentes
Confondre ces variables fausse toute analyse. Une mention nomme votre marque. Une recommandation la présente comme une option pertinente. Une citation rattache la réponse à une source, souvent avec un lien. Un lien cliquable pointe vers un domaine. On peut être mentionné sans être recommandé, cité via une page tierce sans que votre site soit la source, ou recommandé sans aucune citation visible. Interpréter ces écarts (mentionné mais jamais recommandé, par exemple) renvoie aux causes analysées dans pourquoi votre SaaS est invisible dans les réponses des IA.
| Variable | Ce qu'elle indique | Exemple |
|---|---|---|
| Mention | La marque est nommée | « Parmi les options : Marque X » |
| Recommandation | La marque est conseillée pour le besoin | « Pour ce cas, Marque X convient bien » |
| Citation / source | La réponse s'appuie sur une source | Une fiche d'avis citée en référence |
| Lien vers le domaine | Un lien pointe vers votre site | Lien cliquable vers votre page |
Visibilité de marque et visibilité du domaine
Une IA peut citer votre marque sans citer votre site, citer une page de votre site sans recommander le produit, ou recommander le produit en s'appuyant sur une source tierce. Mesurer « la visibilité » sans distinguer ces cas mène à des conclusions fausses.
Les dimensions à mesurer
| Dimension | Question | Métrique type |
|---|---|---|
| Marque | Êtes-vous mentionné ? | Taux de mention |
| Recommandation | Êtes-vous conseillé ? | Taux de recommandation |
| Position | À quel rang ? | Rang moyen, top 3 |
| Thématique | Sur quels besoins ? | Couverture par intention |
| Comparative | Dans les shortlists ? | Présence en comparaison |
| Documentaire | Votre domaine est-il cité ? | Taux de citation du domaine |
| Descriptive | Comment êtes-vous décrit ? | Exactitude descriptive |
| Réputationnelle | Quels avantages / limites ? | Sentiment, tonalité |
| Concurrentielle | Quelle part de l'espace ? | Part de voix |
| Transactionnelle | Sur des requêtes d'achat ? | Présence par étape de funnel |
Pourquoi les réponses varient
En bref
Les réponses varient parce que la génération de texte est probabiliste, et parce que le résultat dépend du prompt, du compte et de la personnalisation, du moteur, du modèle et du mode, et du moment. Ces facteurs se combinent. Conséquence : on ne conclut pas sur une réponse ; on échantillonne, à conditions documentées et constantes.
| Source de variation | Exemple | À faire |
|---|---|---|
| Génération probabiliste | Deux tirages, deux formulations | Répéter, agréger |
| Formulation du prompt | « meilleur X » vs « X pour PME » | Figer les formulations |
| Compte / personnalisation | Historique, mémoire, langue | Sessions vierges si possible, documenter |
| Moteur / modèle / mode | Standard vs recherche web | Segmenter, ne pas mélanger |
| Temps | Actualité, mise à jour du modèle | Dater chaque relevé |
Attention
Dans les interfaces grand public, des réglages comme la « température » ne sont pas exposés : n'affirmez pas connaître les paramètres internes d'un produit. Le biais de position (l'ordre des options influence le classement) est, lui, documenté dans la recherche sur les LLM utilisés comme classeurs (arXiv 2305.08845).
Pourquoi une capture d'écran isolée ne suffit pas
En bref
Une capture d'écran isolée est une observation ponctuelle utile, mais elle ne suffit pas à estimer une visibilité stable, une fréquence ou une évolution. Le problème n'est pas la capture, c'est l'inférence excessive qu'on en tire. Une capture documente un cas daté ; elle ne mesure ni une probabilité, ni une tendance, ni une cause.
| Ce qu'une capture permet | Ce qu'elle ne permet pas |
|---|---|
| Documenter une réponse datée | Estimer une probabilité d'apparition |
| Conserver une preuve | Généraliser à tous les utilisateurs |
| Illustrer une erreur | Comparer proprement deux périodes |
| Constater une citation à un instant | Attribuer une cause à un changement |
Les erreurs d'interprétation les plus fréquentes
- Généraliser à partir d'un seul relevé.
- Ne garder que la meilleure (ou la pire) capture (cherry-picking).
- Changer de prompt ou de modèle entre deux dates.
- Mélanger sessions personnalisées et sessions vierges.
- Confondre présence et recommandation, corrélation et causalité.
Une observation isolée documente un cas ; elle ne mesure pas une visibilité.
Construire le protocole : objectif, périmètre, requêtes
En bref
Un protocole sérieux commence par trois décisions : l'objectif de la mesure (état des lieux, benchmark, suivi de campagne, contrôle de réputation), le périmètre (pays, langue, moteurs, modes, concurrents, période), et l'univers de requêtes, segmenté par intention et figé avant toute mesure. Ces choix se documentent : ils conditionnent l'interprétation.
Définir l'objectif et le périmètre
L'objectif oriente tout le reste. Un état des lieux n'appelle pas le même effort qu'un suivi de campagne ou un contrôle de réputation. Le périmètre se documente précisément : pays, langue, audience, catégorie, concurrents, moteurs, modes, période, compte, statut de connexion, volume maximal de tests.
Construire l'univers de requêtes
Les requêtes doivent refléter les questions réelles de vos acheteurs. Puisez-les dans les entretiens clients, les appels commerciaux, les tickets support, la Search Console, les RFP, les forums et les suggestions de recherche. Segmentez-les par intention : catégorie, besoin métier, secteur, taille d'entreprise, fonctionnalité, comparaison, alternative, migration, conformité, intégration, prix, requête de marque.
| Cluster | Intention | Étape du funnel | Exemple |
|---|---|---|---|
| Catégorie | Découverte | Haut | « Meilleurs logiciels RH pour une PME française » |
| Cas d'usage | Considération | Milieu | « Outil de signature électronique conforme KYC pour un grand compte » |
| Comparaison | Considération | Milieu | « Alternatives à [concurrent] pour 500 salariés » |
| Contrainte | Décision | Bas | « Logiciel RH SSO, RGPD, hébergement européen » |
| Marque | Réputation | Transverse | « Que vaut [votre marque] ? » |
Attention
Séparez toujours les requêtes de marque des requêtes de catégorie : mélanger les deux gonfle artificiellement votre visibilité. Si vous pondérez certaines requêtes (transactionnelles par exemple), fixez la pondération AVANT l'analyse, et conservez les résultats bruts à côté du score pondéré.
Exécuter : formulations, conditions, répétitions, archivage, annotation
En bref
L'exécution obéit à cinq règles : figer et versionner les formulations, documenter les conditions de session, répéter chaque requête (en répartissant les relevés dans le temps), archiver les réponses brutes, et annoter selon un guide stable. Sans ces règles, deux campagnes ne sont pas comparables.
Figer et versionner les formulations
Chaque prompt reçoit un identifiant et une version (par exemple PROMPT-RH-001-v1). Ponctuation, langue, longueur, contraintes, demande de sources, nombre de recommandations demandées : tout est fixé. Ne comparez jamais deux périodes avec des versions de prompt différentes sans le signaler.
Documenter les conditions de session
Pour chaque relevé, enregistrez : moteur, modèle affiché, mode (avec ou sans recherche), date et heure, pays, langue, appareil, statut connecté ou non, mémoire activée ou non, recherche activée ou non, identifiant d'exécution, temps de réponse, erreur éventuelle.
Répéter — sans seuil magique
Répétez chaque requête. Cinq répétitions est un minimum opérationnel, pas une loi. Le nombre requis dépend de la précision recherchée : cinq observations laissent une incertitude large, dix la réduisent modérément. Répartissez les relevés dans le temps (jours et heures différents) si vous voulez mesurer une stabilité, et arbitrez entre couvrir plus de requêtes ou répéter davantage.
| Niveau | Usage | Requêtes | Répétitions | Limite |
|---|---|---|---|---|
| Exploratoire | Détecter des tendances | 10 à 20 | 3 à 5 | Non généralisable |
| Standard | Tableau de bord régulier | 20 à 50 | 5 à 10, réparties | Incertitude encore notable |
| Renforcé | Étude publiable | 50 et plus | 10 et plus, réparties | Coût et temps d'annotation |
Repères opérationnels Evocia, non des standards scientifiques.
Archiver et annoter
Conservez le texte complet, les liens, les citations, la date, le prompt exact, le moteur, le mode et un identifiant unique (formats : JSON, CSV, tableur ou base versionnée). Puis annotez : marque citée et ses variantes, produit, rang, présence dans le top 3, recommandation explicite, tonalité, exactitude de la description, lien vers le domaine, URL citées, type de source, concurrents présents. Fixez un codebook, et contrôlez la qualité par une double annotation sur un sous-échantillon (accord inter-annotateurs). Le dictionnaire de données complet figure plus bas.
Les métriques essentielles
En bref
Un tableau de bord minimal combine plusieurs métriques, jamais une seule : taux de mention, taux de recommandation, présence dans le top N, rang moyen conditionnel, couverture des requêtes et des moteurs, part de voix, taux de citation du domaine, exactitude descriptive et tonalité. Chaque métrique n'a de sens que si son dénominateur et ses conditions sont déclarés.
| Métrique | Formule | Lecture |
|---|---|---|
| Taux de mention | réponses citant la marque / réponses éligibles × 100 | Probabilité d'apparaître |
| Taux de recommandation | réponses la recommandant / réponses éligibles × 100 | Présence qualifiée |
| Présence top 3 | réponses où la marque est dans les 3 premières / réponses × 100 | Visibilité forte |
| Rang moyen conditionnel | moyenne du rang quand la marque apparaît | À lire avec la fréquence |
| Couverture des requêtes | requêtes où la marque apparaît au moins une fois / requêtes × 100 | Étendue de la présence |
| Couverture des moteurs | moteurs où la marque apparaît / moteurs testés | Présence multi-moteurs |
| Part de voix | vos mentions / mentions de toutes les marques suivies × 100 | Poids concurrentiel |
| Taux de citation du domaine | réponses citant votre domaine / réponses avec sources × 100 | Présence documentaire |
| Exactitude descriptive | descriptions exactes / descriptions vérifiées × 100 | Qualité de votre image |
Attention
Le rang moyen est trompeur seul : une marque citée une fois sur vingt mais toujours en première position affiche un « bon » rang moyen. Lisez toujours le rang avec la fréquence. Et déclarez le dénominateur : « taux de citation du domaine » n'a de sens que rapporté aux réponses qui affichent des sources.
Les métriques avancées (et le piège du « score unique »)
En bref
Au-delà de l'essentiel, quelques métriques avancées éclairent la robustesse : stabilité des réponses, diversité et concentration des recommandations, fraîcheur des informations, et part de voix des sources quand elles sont visibles. Un score composite est possible, mais seulement avec une formule transparente, des poids déclarés, et jamais comme référence universelle.
- Stabilité : variation intra-requête, temporelle, entre moteurs et entre modes.
- Diversité / concentration : nombre de marques distinctes citées, domination d'un petit groupe.
- Fraîcheur : part des informations à jour vs obsolètes (anciens prix, fonctions disparues).
- Part de voix des sources : quand les citations sont visibles, quels domaines et types de sources reviennent.
Un « score de visibilité IA » composite (fréquence × poids de position × poids d'intention × qualité) est un indicateur interne, à utiliser pour comparer une même marque à elle-même, au même protocole. Ce n'est pas une référence universelle, et il ne doit jamais masquer les résultats bruts.
Attention
Méfiez-vous des outils qui promettent un « score IA » unique et opaque : agréger moteurs, requêtes et jours dans un seul chiffre fait perdre l'essentiel — où, précisément, vous perdez des citations, et donc quoi corriger.
Quantifier l'incertitude
En bref
Un pourcentage seul est trompeur : 50 % sur 2 observations et 50 % sur 200 n'ont pas la même valeur. Toute fréquence issue d'un petit échantillon doit être accompagnée d'un intervalle d'incertitude, et interprétée en tenant compte de la dépendance entre observations et des comparaisons multiples. C'est ce qui sépare une mesure sérieuse d'un score rassurant mais creux.
Pourquoi un pourcentage seul ne suffit pas
Trois taux identiques peuvent recouvrir des précisions très différentes : 50 % sur 2 relevés, sur 20, sur 200. Plus l'échantillon est petit, plus l'incertitude est large. Un taux sans son nombre d'observations n'est pas interprétable.
Intervalle de confiance pour une proportion
Pour une proportion sur petit échantillon, préférez un intervalle adapté (par exemple l'intervalle de Wilson) à l'intervalle normal naïf, qui se comporte mal quand le taux est proche de 0 ou 100 % ou quand l'échantillon est faible. L'idée à retenir : publiez un taux et sa fourchette.
Dépendance, comparaisons multiples, causalité
Les observations ne sont pas toujours indépendantes (même prompt, même jour, même version) : en tenir compte évite de surestimer la précision (pseudoréplication). Quand vous testez des dizaines de requêtes et de métriques, certains écarts apparaissent par hasard : ne surinterprétez pas un écart isolé. Enfin, un changement statistiquement détectable n'est pas forcément important pour le business, ni attribuable à votre action.
Attention
Corrigez une idée répandue : le nombre de campagnes ne détermine pas à lui seul la significativité. « Une variation sur trois ou quatre campagnes est significative » est faux en général. La significativité dépend de la taille d'échantillon, de l'amplitude de l'effet, de la variance et du protocole, pas du nombre de campagnes.
Exemple complet de calcul (illustratif)
En bref
Voici un calcul de bout en bout, entièrement fictif, pour montrer la démarche. 20 requêtes, 5 répétitions, 4 moteurs : environ 400 réponses. On en tire taux de mention, couverture, présence top 3, rang moyen et part de voix, avec leur lecture. Ce n'est pas une donnée réelle ni une performance Evocia.
Attention
Exemple pédagogique fictif. Chiffres inventés pour illustrer les calculs. Ne pas présenter comme une donnée réelle.
| Marque (fictive) | Taux de mention | Couverture requêtes | Présence top 3 | Rang moyen |
|---|---|---|---|---|
| Marque A | 64 % | 18 / 20 | 52 % | 1,9 |
| Marque B | 47 % | 14 / 20 | 33 % | 2,4 |
| Votre SaaS | 22 % | 7 / 20 | 9 % | 3,6 |
Données fictives, à titre d'illustration.
Lecture : avec 22 % de taux de mention sur environ 100 réponses éligibles, l'intervalle d'incertitude reste large (de l'ordre de ± 8 points) : ne concluez pas sur une petite variation. La couverture (7 / 20) montre que vous êtes absent de 13 requêtes : c'est là que se situe le potentiel. Le rang moyen (3,6) indique que, même cité, vous êtes nommé tard. Priorité : les requêtes à fort potentiel commercial où vous êtes absent.
Faut-il mesurer chaque moteur de la même façon ?
En bref
Non. ChatGPT, Claude, Gemini, Perplexity et les AI Overviews de Google n'offrent pas la même expérience : recherche web plus ou moins systématique, citations plus ou moins visibles, unité d'observation différente. Les AI Overviews, par exemple, se mesurent à l'échelle d'une requête Google, pas d'une conversation. Segmentez, et ne construisez jamais un score global sans conserver les sous-scores.
Attention
Fonctionnalités vérifiées en juillet 2026. Elles varient selon le pays, le plan et la version, et évoluent vite. Ce tableau décrit des comportements observables, pas des mécanismes internes.
| Plateforme | Recherche web | Citations visibles | Unité de mesure | À surveiller |
|---|---|---|---|---|
| ChatGPT | Selon le mode (Search, Deep Research) | Selon le mode | Réponse conversationnelle | Distinguer standard / recherche |
| Claude | Oui, outil de recherche | Présentes, parcimonieuses | Réponse conversationnelle | Avec ou sans recherche |
| Gemini | Intégrée à Google | Selon le grounding | Réponse conversationnelle | Proximité avec Search |
| Perplexity | Systématique | Quasi systématiques | Réponse sourcée | Sources citées |
| Google AI Overviews | S'appuie sur l'index Google | Liens affichés | Requête Google (déclenchée ou non) | Géographie, appareil |
Deux conséquences pratiques. D'abord, pour les AI Overviews, une partie de la mesure est « l'AI Overview s'est-il déclenché, et y figurez-vous ? », très différente d'un taux sur dix réponses de chat. Ensuite, un même travail n'agit pas identiquement partout : chaque moteur a son corpus, ses sources et ses citations.
Où les IA puisent leurs informations (et pourquoi les résultats diffèrent)
En bref
Pour interpréter vos mesures, il faut savoir d'où viennent les recommandations. Une réponse peut mêler connaissances d'entraînement, recherche web, contexte utilisateur et sources non observables. Deux moteurs peuvent recommander des logiciels différents parce que leur corpus, leur recherche, leur modèle et leurs sources diffèrent. Le détail fait l'objet d'un article dédié.
Distinguez l'observable du non-observable : les citations visibles et les résultats de recherche utilisés, mais aussi les connaissances d'entraînement, le contexte de la conversation et la mémoire, qui ne sont pas attribuables de l'extérieur. Ne prétendez jamais reconstruire avec certitude l'origine complète d'une réponse.
Un écart entre moteurs (visible sur Perplexity, absent de ChatGPT) est un signal de diagnostic : il pointe une différence de sources, pas de la malchance. Pour la cartographie complète des familles de sources et des accords de licence, voir où les IA trouvent les informations utilisées pour recommander des logiciels.
Mesure manuelle ou outil automatisé ?
En bref
Les deux ont leur place. La mesure manuelle offre une compréhension fine et coûte peu à démarrer, mais elle plafonne vite en volume et en reproductibilité. L'automatisation apporte volume, régularité et historique, mais l'API ne reproduit pas toujours l'interface, et un score opaque ne remplace pas l'accès aux réponses brutes. Choisissez un outil sur sa transparence, pas sur sa promesse.
| Approche | Force | Limite |
|---|---|---|
| Manuelle | Vérification fine, faible coût de départ | Temps, volume, reproductibilité, biais de l'opérateur |
| Automatisée | Volume, fréquence, historique, uniformité | API différente de l'interface, coûts, conditions d'usage, scores opaques |
Choisir un outil de suivi GEO : la checklist
- Accès aux réponses brutes et transparence du protocole.
- Répétitions, séparation des moteurs, version des modèles, modes de recherche.
- Gestion de la localisation et de la langue.
- Suivi des sources citées et des concurrents.
- Export, API, archivage, historique.
- Contrôle des prompts, gestion des erreurs.
- Intervalles d'incertitude et auditabilité.
À noter
Un score composite propriétaire, sans accès aux données brutes ni au protocole, ne permet ni de vérifier ni de corriger. Préférez un outil qui montre ce qu'il mesure.
Construire un tableau de bord de visibilité IA
En bref
Un bon tableau de bord sert trois publics à trois niveaux de détail : la direction (visibilité globale, évolution, principaux concurrents), le marketing (par cluster, intention, message, sources à travailler), l'analyste (réponses brutes, métadonnées, intervalles, annotations). Le même chiffre agrégé ne sert pas ces trois besoins.
| Vue | Contenu | Décision |
|---|---|---|
| Direction | Visibilité globale, tendance, concurrents, risques | Où investir |
| Marketing | Clusters, intentions, descriptions, sources | Quoi produire ou corriger |
| Analyste | Réponses brutes, métadonnées, intervalles, annotations | Valider et diagnostiquer |
De la mesure à l'action
En bref
La mesure n'a de valeur que si elle débouche sur des décisions. Chaque profil de résultat appelle une correction précise : absence en catégorie, mauvaise description, domaine jamais cité, visibilité concentrée sur un moteur, concurrent dominant, ou visibilité qui monte sans convertir. Priorisez par croisement visibilité × exactitude × potentiel commercial.
| Constat | Cause probable | Action |
|---|---|---|
| Absent des requêtes de catégorie | Positionnement ou sources faibles | Clarifier la catégorie, sources tierces |
| Cité mais mal décrit | Sources obsolètes ou incohérentes | Corriger et dater les informations |
| Domaine jamais cité | Site peu récupérable | Rendre les pages extractibles, données originales |
| Visibilité sur un seul moteur | Sources différentes par moteur | Analyser les sources du moteur absent |
| Concurrent dominant | Meilleure couverture documentaire | Analyse d'écart, requêtes de niche |
| Visibilité en hausse, pas de conversion | Visibilité n'est pas revenu | Relier au pipeline, requêtes transactionnelles |
À noter
Croisez trois axes pour prioriser : la visibilité (êtes-vous vu ?), l'exactitude (êtes-vous bien décrit ?) et le potentiel commercial (la requête mène-t-elle à un achat ?). Une forte visibilité avec description fausse est plus urgente qu'une absence sur une requête sans enjeu.
Peut-on attribuer une hausse à une action GEO ?
En bref
Avec prudence. Mesurer un changement ne prouve pas ce qui l'a causé : le moteur, l'actualité, les concurrents ou la saison peuvent bouger en même temps. Pour se rapprocher d'une attribution, utilisez des groupes de requêtes témoins, un déploiement progressif et un journal des interventions. Et formulez vos conclusions au conditionnel.
- Groupes témoins : des clusters travaillés et des clusters non travaillés, sur la même période et le même protocole.
- Déploiement progressif : agir par lots pour observer l'effet, plutôt que tout changer d'un coup.
- Journal des interventions : dater chaque contenu publié, modification, lien obtenu, mise à jour de profil.
La visibilité a progressé après les interventions, selon le protocole défini. Cela est compatible avec un effet des actions, sans exclure toutes les causes externes.
Attention
Ne présentez jamais un avant / après comme une preuve de causalité. Sans témoin ni journal, une hausse peut venir d'une mise à jour de modèle ou d'un mouvement de vos concurrents.
Les erreurs à éviter
En bref
La plupart des mesures ratées viennent de quelques erreurs récurrentes : ne tester que sa marque, ne tester qu'une fois, changer les prompts, mélanger les modes, oublier la date, confondre rang et fréquence, ou tirer une causalité d'un avant / après. Les repérer suffit à hausser fortement la qualité d'un audit.
| Erreur | Pourquoi c'est un problème |
|---|---|
| Ne tester que sa marque | On ignore la concurrence et la catégorie |
| Tester une seule fois | Une réponse est un tirage, pas une fréquence |
| Modifier les prompts entre deux dates | Les campagnes ne sont plus comparables |
| Mélanger les modes (standard / recherche) | On agrège des choses différentes |
| Oublier la date et la langue | La variation temporelle et linguistique est ignorée |
| Ne mesurer que les liens (ou que les mentions) | On perd une dimension de la visibilité |
| Confondre rang et fréquence | Un bon rang rare est mal interprété |
| Utiliser un score opaque | On ne peut ni vérifier ni corriger |
| Tirer une causalité d'un avant / après | D'autres facteurs ont pu bouger |
| Cherry-picking des meilleures captures | Le résultat est biaisé |
| Changer l'échantillon entre campagnes | La comparaison est faussée |
| Automatiser sans contrôle humain | Les erreurs d'extraction passent |
| Publier sans méthodologie | Le résultat n'est pas crédible |
| Inventer une précision statistique | Fausse rigueur, décisions faussées |
Modèle de protocole et dictionnaire de données
En bref
Pour rendre la méthode reproductible, deux artefacts suffisent : une checklist de campagne (avant, pendant, après) et un dictionnaire de données décrivant chaque colonne à collecter. Les voici. Ils constituent la base d'un tableur ou d'une base de données réutilisable, et rendent toute mesure auditable.
Checklist de campagne
- Avant : objectif, hypothèses, périmètre, moteurs, modes, requêtes figées, concurrents, métriques, répétitions, calendrier, stockage, annotateurs.
- Pendant : respect des formulations, métadonnées, archivage, incidents, contrôle qualité, randomisation de l'ordre.
- Après : nettoyage, annotation, double contrôle, calcul, intervalles, segmentation, interprétation, limites, plan d'action.
Dictionnaire de données
| Colonne | Description |
|---|---|
| run_id / campaign_id | Identifiants d'exécution et de campagne |
| prompt_id / prompt_version / prompt_text | Requête, sa version et son texte exact |
| cluster / funnel_stage | Regroupement et étape du parcours |
| engine / model / mode | Moteur, modèle affiché, mode (recherche ou non) |
| country / language / logged_in | Pays, langue, statut de connexion |
| memory_status / web_search_status | Mémoire et recherche activées ou non |
| date_time / response_raw | Horodatage et réponse brute complète |
| brand_mentioned / recommendation_status / rank / top_3 | Présence, recommandation, rang, top 3 |
| domain_cited / cited_urls / source_types | Domaine cité, URL, types de sources |
| sentiment / description_accuracy / competitors | Tonalité, exactitude, concurrents |
| annotator / quality_flag / notes | Annotateur, contrôle qualité, remarques |
Les études qu'Evocia est en position de produire
En bref
Pour dépasser les impressions, Evocia prépare plusieurs études méthodologiques : variabilité intra-prompt, écart interface / recherche web, marque citée vs domaine cité, effet de la formulation, effet de la langue, décalage entre présence web et visibilité générative, exactitude descriptive. Aucun résultat n'est publié avant validation de l'échantillon.
- Variabilité intra-prompt : à quelle fréquence une recommandation change quand la même requête est répétée.
- Écart interface / recherche web : standard vs recherche vs recherche approfondie.
- Marque citée vs domaine cité : part des liens officiels, des sources tierces, des réponses sans source visible.
- Effet de la formulation : paires de prompts sémantiquement proches (« meilleur » vs « adapté à »).
- Effet de la langue et de la localisation : français vs anglais, France vs autres marchés.
- Décalage entre présence web et visibilité générative, sans en déduire une causalité.
- Exactitude descriptive : erreurs sur prix, cible, fonctions, conformité, statut du produit.
Vous voulez un point de départ mesuré plutôt qu'une impression ? Testez un panel de requêtes représentatives de votre marché et voyez votre présence, moteur par moteur, face à vos concurrents.
Tester la visibilité de mon SaaSQuestions fréquentes
Comment savoir si ChatGPT recommande mon logiciel ?
En mesurant, pas en regardant un écran. Posez un panel de requêtes d'achat de votre catégorie, répétez-les en sessions distinctes, avec et sans recherche web, et relevez si votre marque est mentionnée, recommandée et à quel rang. La fréquence sur plusieurs relevés, pas une réponse isolée, fait foi.
Combien de prompts faut-il tester ?
Une dizaine à une vingtaine pour commencer, classés par intention et formulés comme vos acheteurs. Pour un pilotage fin, cinquante et plus, segmentés par marché. L'important n'est pas le volume brut mais la représentativité des intentions et la stabilité du panel dans le temps.
Combien de fois faut-il répéter chaque requête ?
Cinq est un minimum opérationnel, pas une loi scientifique : cinq observations laissent une incertitude large, dix la réduisent modérément. Le bon nombre dépend de la précision recherchée ; accompagnez toujours un taux de son intervalle d'incertitude, et répartissez les relevés dans le temps pour la stabilité.
Peut-on mesurer ChatGPT avec une seule capture d'écran ?
Non pour mesurer, oui pour documenter. Une capture datée sert à conserver une preuve ou illustrer une erreur, mais elle ne permet ni d'estimer une fréquence, ni de généraliser, ni de comparer deux périodes, ni d'attribuer une cause. Le problème est l'inférence, pas la capture.
Pourquoi les réponses changent-elles d'une session à l'autre ?
La génération est probabiliste : à chaque tirage, plusieurs formulations sont en concurrence. S'y ajoutent le mode, la date, la fraîcheur des sources, la langue et la personnalisation. D'où la nécessité de répéter et de dater, plutôt que de conclure sur une réponse.
Faut-il utiliser un compte vierge ?
Autant que possible, pour limiter la personnalisation, mais ce n'est pas toujours parfaitement réalisable : selon l'outil et le compte, une part de personnalisation peut subsister. Mesurez au mieux et documentez les conditions (connecté ou non, historique, mémoire) plutôt que de prétendre les avoir neutralisées.
Faut-il désactiver la mémoire ?
Si vous voulez mesurer ce que voit un prospect qui ne vous connaît pas, oui : désactivez la mémoire et l'historique quand c'est possible. Sinon, documentez leur état. L'essentiel est la constance : les mêmes conditions d'une campagne à l'autre, pour que les comparaisons tiennent.
Faut-il demander des sources dans le prompt ?
Cela dépend de l'objectif. Demander des sources aide à mesurer la visibilité documentaire (citations, domaines), mais change la réponse par rapport à un prompt naturel. Testez les deux, séparément, et ne comparez jamais un prompt « avec sources » à un prompt « sans » comme s'ils étaient équivalents.
Comment calculer le taux de citation ?
Taux de citation du domaine = réponses citant une page de votre site / réponses analysées (idéalement celles qui affichent des sources) × 100. Déclarez toujours le dénominateur : rapporté à toutes les réponses ou seulement à celles avec sources, le chiffre n'a pas le même sens.
Comment calculer la part de voix dans les IA ?
Part de voix = vos mentions / mentions de toutes les marques suivies × 100, sur un panel figé et répété. Précisez la définition (part des mentions, des recommandations ou des positions) : plusieurs conventions existent, et un chiffre n'est comparable qu'à définition constante.
Quelle différence entre mention et citation ?
Une mention nomme votre marque dans le texte. Une citation rattache une affirmation à une source, souvent avec un lien. On peut être mentionné sans être cité (réponse issue des connaissances du modèle), ou cité via une page tierce sans que votre site soit la source.
Quelle différence entre visibilité de marque et visibilité du site ?
La visibilité de marque, c'est être nommé ou recommandé. La visibilité du site (ou du domaine), c'est que vos pages soient citées comme source. Une IA peut vous recommander en s'appuyant sur une fiche d'avis tierce, sans jamais citer votre site : deux dimensions à mesurer séparément.
Peut-on comparer ChatGPT, Claude et Gemini directement ?
Oui, à condition de segmenter. Ils n'ont pas la même expérience (recherche web, citations, unité d'observation), donc on compare des sous-scores par moteur et par mode, pas un chiffre unique. Les AI Overviews, en particulier, se mesurent à l'échelle d'une requête Google.
À quelle fréquence refaire la mesure ?
Selon l'objectif : un diagnostic ponctuel, un suivi mensuel ou trimestriel, une mesure avant / après campagne, ou une veille rapprochée lors d'un lancement. Soixante jours est un cycle opérationnel courant pour juger des corrections, pas une constante : adaptez à votre rythme de publication et au coût de mesure.
Un score de visibilité IA est-il fiable ?
Un score composite peut aider à suivre une même marque au même protocole, mais un score unique, universel et opaque ne l'est pas : il agrège moteurs, requêtes et jours, et masque où vous perdez des citations. Exigez la formule, les poids et l'accès aux résultats bruts.
Peut-on automatiser les tests ?
Oui, pour le volume, la régularité et l'historique. Mais l'automatisation a des limites : l'API ne reproduit pas toujours l'interface, certaines fonctionnalités manquent, et l'extraction demande un contrôle humain. Choisissez un outil transparent, qui donne accès aux réponses brutes.
L'API donne-t-elle les mêmes résultats que l'interface ?
Pas nécessairement. L'API et l'interface grand public peuvent différer par le modèle, les modes de recherche, la personnalisation et les fonctionnalités disponibles. Ne généralisez pas un résultat d'API à l'expérience réelle d'un utilisateur, ni l'inverse : documentez lequel vous mesurez.
Comment suivre Google AI Overviews ?
L'unité change : on observe, pour une requête Google, si un AI Overview se déclenche, si votre marque y figure et si votre domaine est parmi les liens. Cela dépend du pays, de l'appareil et évolue vite. C'est plus proche d'un suivi SEO enrichi que d'un taux sur des réponses de chat.
Comment mesurer l'impact commercial de la visibilité IA ?
En reliant la visibilité au pipeline : suivez l'évolution de votre part de voix et de votre taux de mention, puis rapprochez-la des demandes entrantes mentionnant l'IA, des cycles de vente et des taux de conversion. Visibilité, clic, lead et revenu sont des étapes distinctes.
Peut-on prouver qu'une action GEO a causé une hausse ?
Rarement de façon certaine. Un avant / après ne prouve pas une causalité : le moteur, l'actualité ou les concurrents peuvent bouger en même temps. Avec des groupes témoins, un déploiement progressif et un journal des actions, on peut rendre l'effet plausible, sans l'affirmer comme certain.
Que faire si une IA décrit mal mon produit ?
Traitez-le comme une priorité : une description fausse ou datée peut coûter aussi cher qu'une absence. Corrigez les sources à la racine (site, fiches, annuaires, communiqués obsolètes), datez et actualisez vos pages, et re-mesurez l'exactitude descriptive au même protocole.
Quelles sources faut-il surveiller ?
Celles qui reviennent dans les réponses de votre catégorie : site officiel, documentation, plateformes d'avis, comparatifs, médias, communautés, dépôts. Mesurez lesquelles ressortent chez vous, plutôt que de supposer. La cartographie détaillée fait l'objet d'un article dédié.
Est-il possible de garantir une citation dans ChatGPT ?
Non. Aucun prestataire sérieux ne peut garantir une recommandation stable ou une position dans un système génératif propriétaire et variable. On peut améliorer la qualité, la disponibilité et la cohérence des informations, puis en mesurer les effets, jamais garantir un résultat.
Combien coûte un audit de visibilité IA ?
Cela dépend du périmètre : nombre de requêtes, de moteurs, de répétitions et de marchés, et du niveau d'annotation. Un diagnostic exploratoire coûte moins qu'une étude renforcée publiable. Le bon repère est le nombre de relevés à produire, pas une promesse de score.
Quelle est la différence entre SEO, GEO et suivi de visibilité IA ?
Le SEO optimise le classement de pages ; le GEO vise la présence dans les réponses génératives ; le suivi de visibilité IA est la mesure de cette présence. On peut faire du GEO sans le mesurer, mais on ne pilote pas ce qu'on ne mesure pas : le suivi transforme l'effort en résultat démontrable.
Sources
- OpenAI, ChatGPT Search (centre d'aide officiel)
- OpenAI, « Introducing deep research » (février 2025)
- OpenAI, documentation des robots (GPTBot, OAI-SearchBot, ChatGPT-User)
- Google, aperçu des robots d'exploration (Googlebot, Google-Extended)
- Hou et al., « Large Language Models are Zero-Shot Rankers for Recommender Systems » (arXiv 2305.08845)
- Liu, Zhang, Liang, « Evaluating Verifiability in Generative Search Engines », EMNLP 2023 (arXiv 2304.09848)
- G2, The Answer Economy (communiqué officiel, avril 2026)
- G2, page corporate de l'étude
- Capterra France, tendances d'achat de logiciels (octobre 2025)
Transparence et méthode
Auteur
Loan Feuillerat · Fondateur d'Evocia
Loan Feuillerat dirige Evocia, cabinet français spécialisé dans la mesure et l'amélioration de la visibilité des éditeurs de SaaS B2B dans les réponses des IA. Cet article décrit le protocole de mesure appliqué dans les diagnostics du cabinet.
Comment cet article a été réalisé
- Recherche documentaire à partir de sources primaires : documentation officielle des moteurs (ChatGPT Search, Deep Research, robots OpenAI, Google), recherche académique sur le biais de position et la fidélité des citations, études de marché (G2, Capterra France). Fonctionnalités vérifiées en juillet 2026.
- Méthodes statistiques standard (intervalle de Wilson, prudence sur les petits échantillons, pseudoréplication, comparaisons multiples) présentées comme telles, sans fausse précision.
- Distinction systématique entre ce qui est documenté, établi par la recherche, observé, ou inconnu publiquement ; entre mesure et causalité.
- Prudence assumée : aucun paramètre interne des produits grand public n'est présenté comme connu ; aucun seuil (répétitions, cadence) n'est présenté comme une loi universelle.
- Limites : les moteurs évoluent vite et une partie de leur fonctionnement reste propriétaire. Les études propriétaires de l'Observatoire Evocia sont en préparation ; aucun chiffre n'est publié avant validation de l'échantillon.
- Validation humaine : contenu rédigé et vérifié par l'équipe d'Evocia, mis à jour au fil des évolutions des moteurs.
Historique des mises à jour
- 18 juillet 2026Publication initiale : le protocole de mesure en trois exigences (requêtes figées, répétitions, archivage).
- 26 juillet 2026Refonte en méthode de référence : taxonomie de la visibilité, sources de variation, protocole complet, métriques essentielles et avancées, quantification de l'incertitude (intervalle de Wilson), comparatif des moteurs, mesure et causalité, dictionnaire de données, FAQ étendue (25 questions) et sources primaires.