Aller au contenu
Evocia

Études · Référence technique · Protocole de l'AI Sources Index, version 1.0 du 2 octobre 2026

Le protocole de l'AI Sources Index, écrit pour être refait par un tiers

Pas un résumé de méthode : la liste de ce qu'il faut savoir pour reposer les mêmes questions au même moteur et obtenir des chiffres comparables aux nôtres. Panel, configuration exacte, répétitions, définition d'une citation, exclusions, erreurs, formules avec leurs dénominateurs, incertitude, limites, versions. Les données qui vont avec sont ouvertes.

Ce que ce protocole permet de reproduire, et ce qu'il ne permet pas

Reproductible

  • Reposer les 250 questions publiées au même moteur, avec la même configuration, et comparer les familles de sources citées.
  • Appliquer les mêmes formules à un autre panel, un autre marché ou une autre langue, en gardant les dénominateurs explicites.
  • Mesurer la variabilité d'un moteur en répétant une même question, et chiffrer ce qu'un relevé unique fait dire de faux.
  • Refaire nos calculs sur nos propres fichiers, ligne à ligne, et nous contredire avec les mêmes données.

Hors de portée

  • Retrouver les mêmes valeurs à une autre date : le moteur, son index et ses réglages changent. Un écart entre deux dates est un résultat, pas une erreur.
  • Transposer à l'interface grand public, qui n'expose pas les citations de la même façon.
  • Mesurer ce qu'une page lue sans être citée a pesé dans la réponse : le protocole sépare les deux populations, il ne pondère pas.
  • Conclure sur les marques recommandées : seules les sources sont mesurées ici.

La question de recherche

Quelles sources, URL et domaines, un moteur génératif cite-t-il lorsqu'un acheteur francophone cherche un logiciel professionnel, et dans quelle mesure ces sources restent les mêmes quand la question est répétée à l'identique ou reformulée.

Deux décisions découlent de cette formulation, et elles conditionnent tout le reste. D'abord l'unité mesurée est la source citée, pas la marque recommandée : une réponse peut recommander un produit sans citer son éditeur, et compter des marques citées dans un texte demande une extraction qui n'est pas assez fiable pour être publiée. Ensuite la stabilité est mesurée, pas supposée : c'est la raison des répétitions, et c'est ce qui permet de dire ce qu'un relevé unique raconte de faux.

Construction du panel

250 questions rédigées avant toute collecte, puis figées. Aucune question n'a été ajoutée, retirée ou réécrite après avoir vu une réponse : c'est la condition pour que les taux aient un sens.

Dataset A, le marché réel

200 requêtes, 800 réponses

Plan factoriel complet et équilibré : 10 catégories de logiciels professionnels, croisées avec cinq intentions d'achat, quatre questions par case. 10 secteurs × 5 intentions × 4 requêtes = 200. C'est la population de toutes les comparaisons par secteur, par intention, de stabilité et de concentration.

Les 10 catégories

CRM & Sales, Marketing Automation, RH & Recrutement, Finance & Spend Management, Cybersécurité, Cloud & Infrastructure, Data & Analytics, Service Client & CCaaS, E-commerce & Paiements, Legal / Compliance / RegTech.

Les cinq intentions

  • Problème / besoin : 160 réponses, recherche web déclenchée dans 24,4 % des cas
  • Découverte de solutions : 160 réponses, recherche web déclenchée dans 90,6 % des cas
  • Recommandation : 160 réponses, recherche web déclenchée dans 94,4 % des cas
  • Comparaison : 160 réponses, recherche web déclenchée dans 100 % des cas
  • Décision / achat : 160 réponses, recherche web déclenchée dans 98,8 % des cas

Dataset B, les reformulations

50 requêtes, 200 réponses

25 expériences, deux variantes chacune, une seule variable modifiée par expérience : la longueur de la question, l'ajout d'un cadre géographique, la mention d'une taille d'entreprise, et ainsi de suite. Les deux variantes sont posées le même jour, dans la même fenêtre, avec la même configuration : l'écart observé ne peut venir que de la formulation.

Ces résultats sont présentés comme exploratoires : une expérience par variable et huit réponses par expérience donnent un ordre de grandeur, pas un effet établi. Un protocole qui voudrait conclure doit multiplier les expériences par variable.

Le texte exact des 250 questions est publié dans requetes.csv : reprendre le panel tel quel est le seul moyen d'obtenir des chiffres comparables aux nôtres. 3 textes apparaissent deux fois, par construction : EXP-01-A et EXP-21-A partagent la variante A ; EXP-01-B reprend CRM-009 et EXP-08-A reprend CX-009. Les identifiants restent distincts et les runs indépendants ; aucune fusion n'est faite.

Moteur et configuration exacte

Dix réglages. Changer l'un d'eux change les résultats, parfois beaucoup : c'est pourquoi ils sont listés avec la raison du choix, et pas seulement avec leur valeur.

RéglageValeur utiliséePourquoi ce choix
InterfaceChatGPT (OpenAI Responses API, outil web_search intégré)L'interface de programmation renvoie les citations sous forme d'annotations structurées. L'interface grand public ne les expose pas de la même façon, et ses résultats ne sont pas comparables.
Modèlegpt-5.6-terraModèle demandé et modèle réellement retourné par l'interface, vérifiés identiques sur toutes les réponses.
Outil de recherche webactivé, taille de contexte de recherche « medium », choix d'outil « auto »Le choix d'outil reste automatique : la décision de chercher ou non appartient au moteur, c'est précisément l'une des variables mesurées.
Effort de raisonnement« low »Réglage le plus proche d'une réponse courante, et le moins coûteux à répliquer.
Plafond de sortie1 200 jetonsAssez pour une réponse complète avec ses citations, assez bas pour éviter les réponses fleuves qui citeraient par accumulation.
Température et germe aléatoirenon transmis, valeurs par défaut de l'interfaceRien n'est forcé : la variabilité observée entre répétitions est celle que rencontre un utilisateur, pas une variabilité réglée par nous.
Prompt système« Réponds à la question en français, de façon concise et factuelle. »Identique pour les mille appels. Aucune consigne sur les sources, aucun format imposé : une consigne de citation biaiserait la mesure.
Localisation transmiseFrance (Paris)Localisation approximative déclarée à l'outil de recherche. Elle change les résultats : la reproduire est indispensable.
LanguefrançaisPanel et consigne en français. Les mesures anglophones publiées ailleurs ne sont pas directement comparables.
Contexte conversationnelaucunChaque appel est indépendant : aucun historique, aucune réponse précédente réinjectée, aucun cache. Deux répétitions ne savent pas qu'elles sont deux répétitions.

Normalisation des URL, appliquée avant tout comptage : hôte en minuscules, préfixe de sous-domaine générique retiré, domaine enregistrable calculé avec la liste publique des suffixes, URL privée de son fragment et de ses paramètres de suivi, paramètres restants triés, barre oblique finale retirée. L'URL d'origine est conservée à côté de l'URL normalisée, et les deux niveaux, hôte et domaine enregistrable, sont gardés : un sous domaine de documentation n'a pas la même fonction que le site qui le porte. 1397 URL, 308 domaines après normalisation.

Répétitions : 4 passages par question, et pourquoi quatre

Chaque question est posée 4 fois par des appels indépendants, sans historique ni cache, dans une fenêtre courte : 10:33 à 10:58 UTC le 14 septembre 2026. La fenêtre de 25 minutes est choisie pour qu'aucune dérive temporelle n'explique un écart entre deux répétitions : ce qui varie vient du moteur, pas du jour.

Pourquoi répéter

Un relevé unique donne un classement, pas une mesure. Sur ce corpus, 38 % des couples requête et domaine n'apparaissent que dans une répétition sur 4 : la moitié de ce qu'un relevé unique affiche ne reviendrait pas au suivant.

Pourquoi quatre

Quatre permet de distinguer quatre niveaux de présence (une fois sur quatre, deux, trois, quatre) et de calculer une amplitude entre relevés. Sur les 10 secteurs, 6 changent de premier domaine entre un relevé et quatre.

Ce que coûte la répétition

40,11 USD pour 1 000 réponses via l'interface de programmation. Le coût n'est pas un obstacle à la répétition : c'est l'argument le plus simple contre les classements à un seul relevé.

Ce qui est compté comme citation, ce qui est exclu

Compté

  • Une citation est une annotation de type « url_citation » que l'interface attache elle même au texte de la réponse. Elle porte une URL, et le plus souvent un titre de page.
  • Toutes les annotations sont comptées, y compris plusieurs vers le même domaine dans une même réponse : la part de citations et la fréquence de réponse mesurent alors deux choses différentes, et les deux sont publiées.
  • 2970 citations inline ; 25906 sources consultées : les deux populations sont conservées, dans deux fichiers distincts.

Exclu

  • Toute URL, tout nom de domaine ou toute marque lue dans le corps du texte sans annotation. Rien n'est extrait du texte par expression régulière : une mention n'est pas une citation.
  • Les pages ouvertes par l'outil de recherche sans annotation. Elles sont relevées à part et n'entrent dans aucune métrique de citation, parce que rien ne permet de dire ce qu'elles ont pesé.
  • Les réponses d'un autre moteur, d'un autre modèle, d'une autre langue ou d'une autre interface : aucune fusion de sources de mesure.

Classification des sources : chaque domaine reçoit un type (site d'éditeur, documentation, institution, standard, analyste, média, comparateur, communauté, encyclopédie, place de marché, réseau social, académique) par un jeu de règles, puis la liste est relue un domaine à la fois. « Site d'éditeur » est le type par défaut d'un domaine commercial. Les familles regroupent ces types : première partie (éditeur et documentation), institutionnel (institution et standard), tierce partie (le reste). Les règles complètes, domaine par domaine, sont dans methodologie.md. C'est l'étape la plus discutable du protocole, et c'est pourquoi la classification est publiée colonne par colonne plutôt que résumée.

Traitement des erreurs et contrôles de collecte

Règle de base : un appel qui échoue est rejoué, un appel qui réussit n'est jamais rejoué. Rien n'est écarté après lecture du résultat, et aucun résultat n'est remplacé par un autre. Les contrôles ci dessous sont recalculés à chaque recalcul du jeu de données.

ContrôleStatutValeurDétail
Requêtes uniques (identifiant)PASS250
Textes de requête uniquesWARNING247 / 2503 textes apparaissent deux fois, par construction : EXP-01-A et EXP-21-A partagent la variante A ; EXP-01-B reprend CRM-009 et EXP-08-A reprend CX-009. Les identifiants restent distincts et les runs indépendants ; aucune fusion n'est faite.
Réponses attendues / terminéesPASS1000 / 1000
4 répétitions par requêtePASS250 / 250 requêtes
Doublons (run_id, response_id)PASS0
Réponses videsPASS0
Erreurs APIPASS0 ; 1 run a nécessité une seconde tentative automatique
Recherche web déclenchéePASS853 réponses sur 1 000Le champ « searched » est renseigné pour chaque réponse ; recherche et citation coïncident exactement (aucune réponse citante sans recherche, aucune recherche sans citation).
Citations structuréesPASS2970 citations inline ; 25906 sources consultéesSeules les annotations url_citation de l'API sont comptées comme citations ; les sources consultées (web_search_call.action.sources) sont analysées séparément.
URL et domaines exploitablesPASS1397 URL, 308 domainesNormalisation runner (www., paramètres de suivi, fragments) revérifiée : domaine enregistrable recalculé cohérent sur 100 % des lignes.
ModèlePASSgpt-5.6-terraUn seul modèle retourné par l'API sur les 1 000 réponses.
Fenêtre de collectePASS14 septembre 2026, 10:33 à 10:58 UTC25 minutes : aucune dérive temporelle possible entre répétitions.
CoûtPASS40.11 USDRecalculé par somme des coûts par réponse.
Indépendance des sessionsPASSappels synchrones sans historiqueSelon la méthodologie du runner : aucune conversation, aucun cache ; les 4 répétitions ont des identifiants de réponse distincts.
Cohérence des catégoriesPASS10 secteurs × 5 intentions × 4 requêtes = 200Le plan d'expérience du dataset A est parfaitement équilibré ; le dataset B porte 25 expériences × 2 variantes.
Classification des sourcesPASS308 domaines classés, 0 inconnuLe fichier livré laissait 253 domaines « unknown » ; ils ont été classés par règles (hôte de documentation, listes d'institutions, standards, médias, analystes) puis relus un par un. Le type « Site d'éditeur » est le type par défaut pour un domaine commercial.

Un point de vocabulaire, parce qu'il crée des confusions entre études : une réponse sans citation n'est pas une erreur. Elle compte au dénominateur des taux de déclenchement de recherche, et elle est exclue des moyennes par réponse citante. Les deux dénominateurs sont donnés à chaque fois.

Indicateurs : formule, population, valeur de contrôle

Chaque indicateur est donné avec son dénominateur et la valeur qu'il prend sur notre collecte. La dernière colonne sert de test : si votre recalcul ne tombe pas sur ces valeurs avec nos fichiers, l'écart vient de la population retenue, pas de la formule.

IndicateurFormulePopulation, dénominateurValeur de contrôle
Search Activation Rateréponses ayant déclenché une recherche web / réponses analysées1 000 réponses (datasets A et B)85,3 %, soit 853 réponses sur 1 000
Citation Sharecitations du domaine ou de la famille de sources / citations totales de la population2 259 citations du dataset A pour les familles de sources71,8 % site d'éditeur, 17,0 % documentation, 8,5 % institutions, 1,6 % tiers
Response Frequencyréponses contenant le domaine au moins une fois / réponses de la population1 000 réponses pour le classement général des domaines308 domaines cités, dont 95 sur 288 une seule fois
Query Coveragerequêtes distinctes où le domaine apparaît / requêtes de la population250 requêtes49 % des citations captées par les vingt premiers domaines
Citation Stabilitypour chaque requête où le domaine apparaît, répétitions le contenant divisées par 4 ; la valeur du domaine est la moyenne sur ces requêtes870 couples requête et domaine du dataset Astabilité moyenne 58 % ; 38 % des couples cités une seule fois sur 4, 27 % quatre fois
Similarité de Jaccarddomaines communs à deux ensembles / domaines de leur union25 expériences de reformulation du dataset B, et les répétitions du dataset A0,55 entre deux répétitions de la même question, 0,37 entre deux reformulations, 0,6 pour la formulation de référence répétée
Concentration (HHI et Shannon)HHI = somme des carrés des parts de citations des domaines d'un secteur ; Shannon = entropie naturelle de la même distributionles 10 secteurs du dataset A, pris un par un22 domaines suffisent à faire la moitié des citations
Amplitude d'un relevé uniquepart du premier domaine d'un secteur sur un relevé unique : part la plus haute moins part la plus basse, en points10 secteurs, 4 relevés comparés un par un puis cumulésde 3,5 à 10,3 points, 6,7 en moyenne ; 6 secteurs sur 10 changent de premier domaine

Règle de population, la plus importante du protocole : les comparaisons par secteur, par intention, de stabilité et de concentration portent sur le dataset A (800 réponses) ; les totaux généraux et le classement des domaines portent sur les 1 000 réponses ; les expériences de reformulation portent sur le dataset B (200 réponses). Mélanger ces populations produit des écarts de plusieurs points, et c'est l'erreur la plus fréquente quand un chiffre est repris sans son dénominateur.

Incertitude : comment elle est calculée et affichée

Intervalle de confiance

Pour une moyenne, intervalle à 95 % : moyenne plus ou moins 1,96 fois l'écart-type divisé par la racine de l'effectif. Il est affiché sur les graphiques de moyennes, et l'effectif est toujours écrit à côté.

Variabilité entre répétitions

Mesurée, pas estimée : 0,55 de domaines communs entre deux répétitions de la même question, contre 0,37 entre deux reformulations. L'écart entre ces deux nombres est l'effet propre de la formulation.

Amplitude d'un relevé unique

Pour chaque secteur, la part du premier domaine est recalculée sur chaque relevé pris seul : l'amplitude va de 3,5 à 10,3 points, 6,7 en moyenne. C'est l'erreur que commet un classement publié sur un seul passage.

Domaines rarement cités

95 sur 288 domaines ne sont cités qu'une seule fois : aucun taux individuel ne doit leur être appliqué. Les analyses par domaine sont restreintes aux domaines présents sur au moins trois requêtes, et ce seuil est indiqué sur chaque graphique concerné.

Limites connues du protocole

Déclarées ici parce qu'un protocole dont les limites ne sont pas écrites n'est pas vérifiable. Elles ne sont pas des réserves de style : chacune interdit une conclusion précise.

  1. Une configuration, pas « les IA »

    Un moteur, un modèle, une interface de programmation, une date, une langue, une localisation. Aucune extrapolation aux autres moteurs, ni à l'interface grand public.

  2. Les citations visibles seulement

    Les pages lues sans être citées ont pu peser sur la réponse. Le protocole les relève, il ne les pondère pas.

  3. Un marché

    250 questions d'acheteurs de logiciels professionnels en français, sur 10 catégories. Rien ne permet d'étendre au grand public ni au commerce de détail.

  4. Une photographie

    4 répétitions dans une fenêtre de quelques minutes mesurent la variabilité à l'instant de la collecte, pas l'évolution dans le temps. Seules des éditions successives le diront.

  5. Reformulations exploratoires

    25 expériences, une par variable, huit réponses chacune : des ordres de grandeur.

  6. Classification humaine

    La taxonomie des sources est relue à la main. Une autre équipe classerait autrement quelques cas limites, et la part par famille en dépend de quelques dixièmes de point.

  7. Pas de mesure des marques

    L'extraction des marques recommandées dans le texte n'a pas été jugée assez fiable pour être publiée. Le lien entre recommandation et citation du site officiel n'est mesuré qu'indirectement.

  8. Dénominateurs à vérifier avant comparaison

    Les études publiées sur ce sujet ne comptent pas la même chose (citations de source contre citations de marque, un moteur contre plusieurs). Une comparaison sans alignement préalable des définitions produit un écart artificiel.

Journal des versions

Un protocole se cite avec son numéro de version. Toute modification d'une définition, d'une formule ou d'une population est datée ici, et un chiffre déjà publié qui en dépendrait serait corrigé et signalé.

  1. 2 octobre 2026 · Protocole 1.0

    Publication du protocole comme page autonome et citable. Aucune définition, aucune formule et aucune population ne change : le contenu est celui de methodologie.md, mis en forme et complété par les contrôles de valeurs. La page de la prestation reste /methode.

  2. 21 septembre 2026 · Présentation

    Dernière modification de la page de l'étude (en tête, filtres, format des taux). Aucun effet sur les données ni sur le protocole.

  3. 17 septembre 2026 · Taxonomie

    Relecture de la classification des sources : les domaines qui n'apparaissent que dans le fichier des pages consultées tombaient auparavant dans le type par défaut « site d'éditeur ». Aucun domaine cité n'a changé de type, donc aucune métrique de citation n'est affectée ; seule la répartition par type des pages consultées l'est. 308 domaines classés, 0 inconnu.

  4. 14 septembre 2026 · Collecte

    Exécution du protocole : 250 requêtes, 4 répétitions, 1 000 réponses, 2 970 citations, 308 domaines, 25 906 pages consultées. Fenêtre : 10:33 à 10:58 UTC. Coût : 40,11 USD.

Citation suggérée : Evocia, protocole de mesure de l'AI Sources Index, version 1.0, 2 octobre 2026, https://evocia.fr/etudes/protocole-de-mesure, licence CC BY 4.0.

Cette page et les autres

Deux protocoles coexistent sur le site, et ils ne disent pas la même chose. Celui de cette page est le protocole de l'étude publique, version 1.0 : un panel figé, un seul moteur, des données ouvertes, et des chiffres publiés. Celui de notre méthode (Protocole v1.1, 2 octobre 2026) est le protocole des missions : il applique les mêmes règles de mesure à une entreprise, sur plusieurs moteurs, avec son propre panel, et ces relevés ne sont jamais publiés. Les définitions, les formules et les dénominateurs sont communs aux deux ; le périmètre et la publication diffèrent.

  • Les résultats

    L'étude commentée, ses graphiques et leur export, le rapport de qualité.

  • Les données

    Les fichiers, leur granularité, leur nombre de lignes, et trois recalculs détaillés.

  • Pour la presse

    Dix chiffres avec leur dénominateur, un paragraphe citable, la licence et un contact.

Étude publiée le 14 septembre 2026 · toutes les études · une question sur le protocole : contact@evocia.fr