# Evocia AI Sources Index 2026 : dictionnaire des données

Licence CC BY 4.0. Attribution : « Source : Evocia AI Sources Index 2026, evocia.fr ».
Collecte : 14 septembre 2026, 10:33 à 10:58 UTC. Moteur : ChatGPT via l'API Responses d'OpenAI, modèle gpt-5.6-terra, outil de recherche web intégré.

## requetes.csv (250 lignes)
- id_requete : identifiant unique (ex. CRM-001, EXP-01-A).
- dataset : A = marché réel (200), B = expérimental (50).
- type : market_real ou experiment.
- secteur : l'un des 10 secteurs B2B.
- intention : Problème / besoin, Découverte de solutions, Recommandation, Comparaison, Décision / achat, Expérimental.
- experience, variante, variable_testee : dataset B uniquement (EXP-01 à EXP-25, A ou B, variable modifiée).
- requete : texte exact envoyé au modèle.

## reponses.csv (1 000 lignes)
- id_reponse : identifiant du run ; id_requete ; repetition (1 à 4).
- modele : modèle retourné par l'API.
- debut, fin (ISO 8601 UTC), duree_ms.
- recherche_web : 1 si l'outil de recherche a été déclenché, 0 sinon.
- nb_recherches : nombre d'appels à l'outil de recherche dans la réponse.
- nb_citations : nombre d'annotations url_citation renvoyées.
- tokens_sortie, cout_usd : usage et coût calculés depuis l'API.
- texte_reponse : texte intégral de la réponse.

## citations.csv (2 970 lignes) : une ligne par citation structurée
- id_citation, id_reponse, id_requete, repetition, secteur, intention.
- position : rang de la citation dans la réponse.
- url_originale : telle que renvoyée par l'API ; url_normalisee : sans fragment, sans paramètres de suivi, sans slash final.
- hote : nom d'hôte (learn.microsoft.com) ; domaine : domaine enregistrable (microsoft.com) selon la Public Suffix List.
- titre_source : titre de la page si renvoyé.
- type_source : editeur, documentation, institution, standard, analyste, media, comparateur, communaute, academique, marketplace, social, encyclopedie, autre.
- type_source_libelle : libellé français ; famille : first_party, institutional, third_party.

## sources-consultees.csv (25 906 lignes) : pages lues par l'outil de recherche
Mêmes colonnes que citations.csv, sans titre ni URL originale. Une page consultée n'est pas nécessairement citée. Ces lignes n'entrent pas dans les métriques de citation.

## domaines.csv (308 lignes) : métriques par domaine sur les 1 000 réponses
- rang : par nombre de réponses citantes.
- citations ; reponses_citantes ; response_frequency = reponses_citantes / 1 000.
- citation_share = citations / 2 970.
- requetes_couvertes ; query_coverage = requetes_couvertes / 250.
- citation_stability : moyenne, sur les requêtes où le domaine apparaît, de (répétitions le contenant / 4).
- part_requetes_4_sur_4 : part de ces requêtes où le domaine apparaît dans les 4 répétitions.
- urls_distinctes ; secteurs et intentions où le domaine est cité (séparateur « ; »).

## experiences-ab.csv (25 lignes)
- experience, secteur, variable_testee, requete_A, requete_B.
- domaines_A, domaines_B : union des domaines cités sur les 4 répétitions de chaque variante.
- domaines_communs, domaines_nouveaux (B seulement), domaines_disparus (A seulement).
- jaccard = communs / union.
- recherche_web_A/B : part des 4 réponses avec recherche ; citations_par_reponse_A/B.
