Science · Fondements
Construire une population, pas une collection de personas.
Nous partons de données de référence, transformées en contraintes statistiques. Une distribution de population est générée sous ces contraintes, puis calibrée avant d'être structurée en individus synthétiques interrogables.
Données → contraintes → population.
- 01Données de référence
Données publiques pertinentes (INSEE au niveau IRIS, données sectorielles, enquêtes nationales) et données propriétaires anonymisées lorsqu'elles existent.
- 02Contraintes
Distributions marginales et croisées que la population devra satisfaire.
- 03Maximum Entropy Relaxation
Les contraintes sont recastées en un problème d'optimisation convexe, satisfaites en espérance plutôt qu'exactement.
- 04Population
Distribution de famille exponentielle sur les configurations complètes d'individus, puis calibrée par mesure des écarts aux cibles.
- 05Individus synthétiques
Configurations complètes d'attributs, cohérentes entre elles, pertinentes pour la décision étudiée.
- 06Entretiens
Entretiens qualitatifs structurés avec relance contextualisée sur les points de friction.
Maximum Entropy Relaxation.
Formulation
p(x) = exp( Σₖ λₖ · fₖ(x) ) / Z(λ)
- p(x)probabilité d'une configuration complète d'individu x
- fₖ(x)contrainte statistique k (marginale, binaire ou ternaire), satisfaite en espérance
- λₖmultiplicateur de Lagrange associé à la contrainte k, obtenu par optimisation convexe duale
- Z(λ)constante de normalisation de la famille exponentielle
Parmi les distributions compatibles avec les contraintes, retenir celle qui ajoute le moins de structure supplémentaire.
SourceFrançois Pachet, Jean-Daniel Zucker — Maximum Entropy Relaxation of Multi-Way Cardinality Constraints for Synthetic Population Generation, ArXiv (preprint, non relu par les pairs) — 2026 — ArXiv:2603.22558 Consulter
Principe hérité de Jaynes (1957) ; contraintes de cardinalité héritées de Régin (1996).
Respecter chaque variable n'est pas respecter leurs croisements.
Illustration conceptuelle. Un échantillonnage marginal peut violer des combinaisons entières d'attributs sans que rien ne le détecte. Les contraintes retenues portent aussi sur les croisements.
Une population n'est pas une moyenne.
La population conserve une diversité compatible avec les contraintes retenues : chaque individu synthétique est une configuration complète d'attributs, interrogée dans sa configuration propre et non au titre d'un profil moyen. Les typologies de lecture sont un outil d'analyse ; la simulation continue de porter sur les individus.
Illustration conceptuelle. Aucune donnée réelle n'est représentée.
De la population aux individus interrogeables.
- 01Question
Protocole d'entretien calibré pour la décision étudiée.
- 02Réponse
L'individu synthétique répond dans sa configuration propre.
- 03Relance contextualisée
Les points de friction identifiés sont creusés plutôt que contournés.
- 04Synthèse
Les insights sont restitués avec le lien vers les entretiens qui les ont produits.
Structure de population
- Données de référence
- Contraintes statistiques
- Calibration et mesure des écarts
Le LLM est une couche d'interaction
- Dialogue contextualisé de l'entretien
- Registre linguistique de l'individu interrogé
- Restitution structurée des réponses
Le modèle de langage est la couche d'exécution, pas la population : les propriétés statistiques sont contrôlées et mesurées en amont.
Des résultats contestables ligne à ligne.
- 01Résultat restitué au client.
- 02Entretiens individuels qui l'ont produit.
- 03Population et contraintes appliquées.
- 04Données de référence et rapport de calibration.
Ce que la méthode ne prétend pas
- La population synthétique ne prédit pas une personne réelle.
- Un individu synthétique n'a pas vécu l'expérience réelle.
- Sans données de référence fiables, le résultat reste exploratoire.
- Une simulation ne remplace pas une obligation réglementaire.
Votre prochaine décision
Quelle décision voulez-vous explorer ?
Décrivez votre besoin. Nous pouvons vous orienter vers le mode d’accompagnement adapté.