Études · Données ouvertes · Mis à jour le 2 octobre 2026
Télécharger les relevés de l'AI Sources Index 2026
Le relevé brut, pas un résumé : 7 tables au format CSV, un classeur et un dictionnaire, sous licence CC BY 4.0. Chaque fichier est décrit ici par ce qu'il contient, par ce que représente une de ses lignes et par son nombre de lignes, compté dans le fichier lui même. Trois recalculs sont détaillés pour que vous puissiez retrouver nos chiffres sans nous croire.
- tables au format CSV
- 7
- tables au format CSV
- lignes de données
- 30 536
- lignes de données
- de fichiers publiés
- 11,6 Mo
- de fichiers publiés
- réutilisation avec attribution
- CC BY 4.0
- réutilisation avec attribution
Ce que couvre ce jeu de données
Une seule collecte, 14 septembre 2026 : 250 questions d'acheteurs de logiciels professionnels en français, chacune posée 4 fois à ChatGPT par des appels indépendants, soit 1 000 réponses. Les fichiers contiennent 2 970 citations vers 308 domaines, et 25 906 pages ouvertes par l'outil de recherche sans avoir été nécessairement citées. Rien n'est agrégé ni anonymisé : vous avez le texte des questions, le texte des réponses et les URL.
Ce qu'ils permettent
Recalculer tous les chiffres publiés, en tester d'autres découpages, comparer avec une autre mesure, ou rejouer le protocole sur un autre panel.
Ce qu'ils ne contiennent pas
Aucune donnée client, aucune donnée personnelle, aucun relevé de mission. Les corpus des missions ne sont jamais publiés.
Ce qu'ils ne disent pas
Un seul moteur, une seule configuration, une seule journée, un seul marché. La portée exacte et les limites sont dans le protocole.
Les tables, une par une
Nombres de lignes et de colonnes relus dans les fichiers publiés, pas estimés. Encodage UTF-8 ; le séparateur de chaque fichier est indiqué sur sa fiche.
requetes.csv
250 lignes · 9 colonnes · 36 ko
Le panel complet, texte exact des questions envoyées au moteur, avec leur secteur, leur intention d'achat, leur dataset (A pour le marché réel, B pour les expériences de reformulation) et, pour le dataset B, la variable testée.
- Granularité
- une ligne par requête du panel
- Colonnes principales
- id_requete, dataset, secteur, intention, requete
- Format
- CSV, UTF-8, séparateur virgule
reponses.csv
1 000 lignes · 13 colonnes · 2,2 Mo
Chaque appel au moteur : horodatage de début et de fin, durée, modèle réellement retourné, déclenchement ou non de la recherche web, nombre d'appels à l'outil de recherche, nombre de citations, coût, et le texte intégral de la réponse.
- Granularité
- une ligne par réponse, soit une requête et une répétition
- Colonnes principales
- id_reponse, id_requete, repetition, recherche_web, nb_citations, cout_usd, texte_reponse
- Format
- CSV, UTF-8, séparateur virgule
citations.csv
2 970 lignes · 15 colonnes · 1,1 Mo
Toutes les citations structurées renvoyées par l'interface de programmation : URL d'origine et URL normalisée, hôte, domaine enregistrable, titre de la page quand il est fourni, position dans la réponse, type et famille de source.
- Granularité
- une ligne par citation
- Colonnes principales
- id_citation, id_reponse, url_normalisee, hote, domaine, type_source, famille
- Format
- CSV, UTF-8, séparateur virgule
sources-consultees.csv
25 906 lignes · 11 colonnes · 5,5 Mo
Les pages ouvertes par l'outil de recherche du moteur, qu'elles aient été citées ou non. C'est le fichier qui permet de séparer ce que le moteur lit de ce qu'il crédite, et il n'entre dans aucune métrique de citation.
- Granularité
- une ligne par page consultée dans une réponse
- Colonnes principales
- id_reponse, id_requete, position, url_normalisee, hote, domaine, type_source
- Format
- CSV, UTF-8, séparateur virgule
domaines.csv
308 lignes · 16 colonnes · 48 ko
Le classement des domaines cités, avec leurs indicateurs déjà calculés : fréquence de réponse, part de citations, couverture du panel, stabilité entre répétitions, part des requêtes où le domaine sort dans les quatre répétitions, et la liste des secteurs et intentions où il apparaît.
- Granularité
- une ligne par domaine cité
- Colonnes principales
- rang, domaine, citations, response_frequency, citation_share, query_coverage, citation_stability
- Format
- CSV, UTF-8, séparateur virgule
experiences-ab.csv
25 lignes · 15 colonnes · 11 ko
Les expériences de reformulation du dataset B : les deux variantes d'une même question, la seule variable modifiée entre elles, les domaines cités par chacune, les domaines communs, apparus et disparus, et leur similarité de Jaccard.
- Granularité
- une ligne par expérience, soit un couple de variantes
- Colonnes principales
- experience, variable_testee, requete_A, requete_B, jaccard, domaines_communs
- Format
- CSV, UTF-8, séparateur virgule
chiffres-cles.csv
77 lignes · 4 colonnes · 12 ko
Tous les chiffres publiés de l'étude sous forme de lignes : l'indicateur, sa valeur, son dénominateur et sa définition. C'est le fichier à ouvrir en premier pour vérifier un pourcentage lu dans un article.
- Granularité
- une ligne par indicateur publié
- Colonnes principales
- indicateur, valeur, denominateur, definition
- Format
- CSV, UTF-8, séparateur point virgule
Le classeur et le dictionnaire
Le classeur
2,7 Mo
evocia-ai-sources-index-2026.xlsx
Les sept tables ci-dessus réunies dans un seul classeur, une feuille par fichier, plus le dictionnaire et la méthodologie. À prendre si vous travaillez au tableur plutôt qu'en ligne de commande : les types de colonnes y sont déjà posés et l'encodage ne pose pas de question.
TéléchargerLe dictionnaire
3 ko
dictionnaire.md
Chaque fichier, chaque colonne, son type et sa définition, avec les valeurs admises pour les champs codés (dataset, intention, type de source, famille). À lire avant tout recalcul : la définition de la colonne compte plus que son nom.
Télécharger
Un manifeste fichiers.json accompagne le dossier : il liste chaque fichier avec sa taille, ses colonnes et son nombre de lignes, de sorte que vous pouvez vérifier que votre copie est complète. C'est lui qui alimente les nombres de cette page.
Trois analyses que vous pouvez refaire vous même
Chacune se fait au tableur ou en quelques lignes de code, uniquement avec les fichiers ci-dessus. Le résultat attendu est celui que publie l'étude : s'il ne tombe pas, écrivez-nous, l'erreur est peut être la nôtre.
01
Refaire la part des sources de première partie
citations.csv et requetes.csv
- Dans requetes.csv, retenir les identifiants dont la colonne dataset vaut A : c'est le panel de marché réel, et la population de ce chiffre.
- Dans citations.csv, ne garder que les lignes dont id_requete appartient à cette liste.
- Compter les lignes dont la colonne famille vaut first_party, puis diviser par le nombre de lignes retenues.
Résultat attendu : 89 % des 2 259 citations du dataset A, dont 71,8 % vers le site d'un éditeur et 17,0 % vers sa documentation.
02
Refaire l'écart entre pages lues et pages citées
sources-consultees.csv et citations.csv
- Dans sources-consultees.csv, compter les id_reponse distincts où la colonne domaine vaut reddit.com : c'est le nombre de réponses où le moteur a ouvert le site.
- Dans citations.csv, compter les lignes où domaine vaut reddit.com : c'est le nombre de citations qu'il a reçues.
- Refaire l'opération avec wikipedia.org, puis sur l'ensemble des deux fichiers pour obtenir les moyennes par réponse.
Résultat attendu : reddit.com consulté dans 100 réponses pour 0 citation, wikipedia.org dans 85 pour 0, et 27 pages lues contre 3,4 citées par réponse.
03
Refaire la stabilité des sources entre répétitions
citations.csv
- Se limiter aux citations du dataset A, puis construire les couples requête et domaine distincts.
- Pour chaque couple, compter le nombre de répétitions différentes où le domaine apparaît : une valeur de 1 à 4.
- Faire la distribution de ces comptes, et la moyenne du rapport de ce compte sur quatre.
Résultat attendu : 38 % des couples requête et domaine n'apparaissent que dans une répétition sur 4, 27 % dans les quatre, sur 870 couples ; stabilité moyenne 58 %.
Les formules exactes des indicateurs, leurs dénominateurs et leurs populations sont dans le protocole de mesure. Les valeurs publiées, ligne par ligne, sont sur chiffres de la visibilité dans les IA.
Licence et attribution
Ce que la licence autorise
Tous les fichiers sont publiés sous licence Creative Commons CC BY 4.0 : copie, redistribution, transformation et usage commercial, à la seule condition de citer la source et d'indiquer si vous avez modifié les données. Aucune autorisation préalable, aucune déclaration d'usage.
Les URL et les titres de pages contenus dans les fichiers appartiennent à leurs éditeurs respectifs : la licence porte sur le relevé, pas sur les contenus relevés.
Comment citer
Source : Evocia AI Sources Index 2026, evocia.fr
Citation complète : Evocia, Evocia AI Sources Index 2026, données ouvertes, collecte du 14 septembre 2026, https://evocia.fr/etudes/donnees-ouvertes, licence CC BY 4.0.
Pour un chiffre isolé, reprenez l'indicateur, la valeur et le dénominateur de chiffres-cles.csv. Un dossier de presse rassemble les dix chiffres les plus repris avec leur population : page presse.
Où aller ensuite
Panel, configuration du moteur, définition d'une citation, exclusions, formules, incertitude, limites.
Les résultats commentés, les graphiques et leur export, le rapport de qualité. Publiée le 14 septembre 2026.
Une ligne par indicateur, avec sa population, sa source, sa date, son périmètre et son niveau de preuve.
Une question sur un fichier ou un découpage qui vous manque : contact@evocia.fr.