Aller au contenu
Evocia

Études · Données ouvertes · Mis à jour le 2 octobre 2026

Télécharger les relevés de l'AI Sources Index 2026

Le relevé brut, pas un résumé : 7 tables au format CSV, un classeur et un dictionnaire, sous licence CC BY 4.0. Chaque fichier est décrit ici par ce qu'il contient, par ce que représente une de ses lignes et par son nombre de lignes, compté dans le fichier lui même. Trois recalculs sont détaillés pour que vous puissiez retrouver nos chiffres sans nous croire.

tables au format CSV
7
tables au format CSV
lignes de données
30 536
lignes de données
de fichiers publiés
11,6 Mo
de fichiers publiés
réutilisation avec attribution
CC BY 4.0
réutilisation avec attribution

Ce que couvre ce jeu de données

Une seule collecte, 14 septembre 2026 : 250 questions d'acheteurs de logiciels professionnels en français, chacune posée 4 fois à ChatGPT par des appels indépendants, soit 1 000 réponses. Les fichiers contiennent 2 970 citations vers 308 domaines, et 25 906 pages ouvertes par l'outil de recherche sans avoir été nécessairement citées. Rien n'est agrégé ni anonymisé : vous avez le texte des questions, le texte des réponses et les URL.

Ce qu'ils permettent

Recalculer tous les chiffres publiés, en tester d'autres découpages, comparer avec une autre mesure, ou rejouer le protocole sur un autre panel.

Ce qu'ils ne contiennent pas

Aucune donnée client, aucune donnée personnelle, aucun relevé de mission. Les corpus des missions ne sont jamais publiés.

Ce qu'ils ne disent pas

Un seul moteur, une seule configuration, une seule journée, un seul marché. La portée exacte et les limites sont dans le protocole.

Les tables, une par une

Nombres de lignes et de colonnes relus dans les fichiers publiés, pas estimés. Encodage UTF-8 ; le séparateur de chaque fichier est indiqué sur sa fiche.

  • requetes.csv

    250 lignes · 9 colonnes · 36 ko

    Le panel complet, texte exact des questions envoyées au moteur, avec leur secteur, leur intention d'achat, leur dataset (A pour le marché réel, B pour les expériences de reformulation) et, pour le dataset B, la variable testée.

    Granularité
    une ligne par requête du panel
    Colonnes principales
    id_requete, dataset, secteur, intention, requete
    Format
    CSV, UTF-8, séparateur virgule
    Télécharger requetes.csv
  • reponses.csv

    1 000 lignes · 13 colonnes · 2,2 Mo

    Chaque appel au moteur : horodatage de début et de fin, durée, modèle réellement retourné, déclenchement ou non de la recherche web, nombre d'appels à l'outil de recherche, nombre de citations, coût, et le texte intégral de la réponse.

    Granularité
    une ligne par réponse, soit une requête et une répétition
    Colonnes principales
    id_reponse, id_requete, repetition, recherche_web, nb_citations, cout_usd, texte_reponse
    Format
    CSV, UTF-8, séparateur virgule
    Télécharger reponses.csv
  • citations.csv

    2 970 lignes · 15 colonnes · 1,1 Mo

    Toutes les citations structurées renvoyées par l'interface de programmation : URL d'origine et URL normalisée, hôte, domaine enregistrable, titre de la page quand il est fourni, position dans la réponse, type et famille de source.

    Granularité
    une ligne par citation
    Colonnes principales
    id_citation, id_reponse, url_normalisee, hote, domaine, type_source, famille
    Format
    CSV, UTF-8, séparateur virgule
    Télécharger citations.csv
  • sources-consultees.csv

    25 906 lignes · 11 colonnes · 5,5 Mo

    Les pages ouvertes par l'outil de recherche du moteur, qu'elles aient été citées ou non. C'est le fichier qui permet de séparer ce que le moteur lit de ce qu'il crédite, et il n'entre dans aucune métrique de citation.

    Granularité
    une ligne par page consultée dans une réponse
    Colonnes principales
    id_reponse, id_requete, position, url_normalisee, hote, domaine, type_source
    Format
    CSV, UTF-8, séparateur virgule
    Télécharger sources-consultees.csv
  • domaines.csv

    308 lignes · 16 colonnes · 48 ko

    Le classement des domaines cités, avec leurs indicateurs déjà calculés : fréquence de réponse, part de citations, couverture du panel, stabilité entre répétitions, part des requêtes où le domaine sort dans les quatre répétitions, et la liste des secteurs et intentions où il apparaît.

    Granularité
    une ligne par domaine cité
    Colonnes principales
    rang, domaine, citations, response_frequency, citation_share, query_coverage, citation_stability
    Format
    CSV, UTF-8, séparateur virgule
    Télécharger domaines.csv
  • experiences-ab.csv

    25 lignes · 15 colonnes · 11 ko

    Les expériences de reformulation du dataset B : les deux variantes d'une même question, la seule variable modifiée entre elles, les domaines cités par chacune, les domaines communs, apparus et disparus, et leur similarité de Jaccard.

    Granularité
    une ligne par expérience, soit un couple de variantes
    Colonnes principales
    experience, variable_testee, requete_A, requete_B, jaccard, domaines_communs
    Format
    CSV, UTF-8, séparateur virgule
    Télécharger experiences-ab.csv
  • chiffres-cles.csv

    77 lignes · 4 colonnes · 12 ko

    Tous les chiffres publiés de l'étude sous forme de lignes : l'indicateur, sa valeur, son dénominateur et sa définition. C'est le fichier à ouvrir en premier pour vérifier un pourcentage lu dans un article.

    Granularité
    une ligne par indicateur publié
    Colonnes principales
    indicateur, valeur, denominateur, definition
    Format
    CSV, UTF-8, séparateur point virgule
    Télécharger chiffres-cles.csv

Le classeur et le dictionnaire

  • Le classeur

    2,7 Mo

    evocia-ai-sources-index-2026.xlsx

    Les sept tables ci-dessus réunies dans un seul classeur, une feuille par fichier, plus le dictionnaire et la méthodologie. À prendre si vous travaillez au tableur plutôt qu'en ligne de commande : les types de colonnes y sont déjà posés et l'encodage ne pose pas de question.

    Télécharger
  • Le dictionnaire

    3 ko

    dictionnaire.md

    Chaque fichier, chaque colonne, son type et sa définition, avec les valeurs admises pour les champs codés (dataset, intention, type de source, famille). À lire avant tout recalcul : la définition de la colonne compte plus que son nom.

    Télécharger

Un manifeste fichiers.json accompagne le dossier : il liste chaque fichier avec sa taille, ses colonnes et son nombre de lignes, de sorte que vous pouvez vérifier que votre copie est complète. C'est lui qui alimente les nombres de cette page.

Trois analyses que vous pouvez refaire vous même

Chacune se fait au tableur ou en quelques lignes de code, uniquement avec les fichiers ci-dessus. Le résultat attendu est celui que publie l'étude : s'il ne tombe pas, écrivez-nous, l'erreur est peut être la nôtre.

  1. 01

    Refaire la part des sources de première partie

    citations.csv et requetes.csv

    1. Dans requetes.csv, retenir les identifiants dont la colonne dataset vaut A : c'est le panel de marché réel, et la population de ce chiffre.
    2. Dans citations.csv, ne garder que les lignes dont id_requete appartient à cette liste.
    3. Compter les lignes dont la colonne famille vaut first_party, puis diviser par le nombre de lignes retenues.

    Résultat attendu : 89 % des 2 259 citations du dataset A, dont 71,8 % vers le site d'un éditeur et 17,0 % vers sa documentation.

  2. 02

    Refaire l'écart entre pages lues et pages citées

    sources-consultees.csv et citations.csv

    1. Dans sources-consultees.csv, compter les id_reponse distincts où la colonne domaine vaut reddit.com : c'est le nombre de réponses où le moteur a ouvert le site.
    2. Dans citations.csv, compter les lignes où domaine vaut reddit.com : c'est le nombre de citations qu'il a reçues.
    3. Refaire l'opération avec wikipedia.org, puis sur l'ensemble des deux fichiers pour obtenir les moyennes par réponse.

    Résultat attendu : reddit.com consulté dans 100 réponses pour 0 citation, wikipedia.org dans 85 pour 0, et 27 pages lues contre 3,4 citées par réponse.

  3. 03

    Refaire la stabilité des sources entre répétitions

    citations.csv

    1. Se limiter aux citations du dataset A, puis construire les couples requête et domaine distincts.
    2. Pour chaque couple, compter le nombre de répétitions différentes où le domaine apparaît : une valeur de 1 à 4.
    3. Faire la distribution de ces comptes, et la moyenne du rapport de ce compte sur quatre.

    Résultat attendu : 38 % des couples requête et domaine n'apparaissent que dans une répétition sur 4, 27 % dans les quatre, sur 870 couples ; stabilité moyenne 58 %.

Les formules exactes des indicateurs, leurs dénominateurs et leurs populations sont dans le protocole de mesure. Les valeurs publiées, ligne par ligne, sont sur chiffres de la visibilité dans les IA.

Licence et attribution

Ce que la licence autorise

Tous les fichiers sont publiés sous licence Creative Commons CC BY 4.0 : copie, redistribution, transformation et usage commercial, à la seule condition de citer la source et d'indiquer si vous avez modifié les données. Aucune autorisation préalable, aucune déclaration d'usage.

Les URL et les titres de pages contenus dans les fichiers appartiennent à leurs éditeurs respectifs : la licence porte sur le relevé, pas sur les contenus relevés.

Comment citer

Source : Evocia AI Sources Index 2026, evocia.fr

Citation complète : Evocia, Evocia AI Sources Index 2026, données ouvertes, collecte du 14 septembre 2026, https://evocia.fr/etudes/donnees-ouvertes, licence CC BY 4.0.

Pour un chiffre isolé, reprenez l'indicateur, la valeur et le dénominateur de chiffres-cles.csv. Un dossier de presse rassemble les dix chiffres les plus repris avec leur population : page presse.

Où aller ensuite

  • Le protocole

    Panel, configuration du moteur, définition d'une citation, exclusions, formules, incertitude, limites.

  • L'étude

    Les résultats commentés, les graphiques et leur export, le rapport de qualité. Publiée le 14 septembre 2026.

  • Les chiffres

    Une ligne par indicateur, avec sa population, sa source, sa date, son périmètre et son niveau de preuve.

Une question sur un fichier ou un découpage qui vous manque : contact@evocia.fr.