CIENCIA · FUNDAMENTOS METODOLÓGICOS

Una disciplina construida sobre una base matemática rigurosa.

Nuestras poblaciones sintéticas no se simulan por LLM ni se calibran a ojo. Se generan bajo restricciones estadísticas multidimensionales, con propiedades explícitamente controladas y desviaciones respecto a las referencias medidas y publicadas.

DE DÓNDE VENIMOS CIENTÍFICAMENTE

Cuatro tradiciones científicas articuladas en torno a una base matemática.

No inventamos una metodología ex nihilo. Articulamos cuatro tradiciones científicas establecidas en una combinación inédita. Cada una aporta un ladrillo específico. Juntas producen lo que ninguna podía producir por separado: la inteligencia de decisiones por población sintética.

La programación por restricciones y la modelización probabilística. Nuestra base matemática.

Imagine All The People combina métodos de satisfacción de restricciones, heredados de los trabajos de Régin (1996) sobre la Global Cardinality Constraint, y métodos de modelización probabilística, heredados del principio de Maximum Entropy formalizado por Jaynes (1957). El objetivo es construir poblaciones sintéticas coherentes con un conjunto de estadísticas de referencia: las distribuciones marginales, por ejemplo el 52 % de mujeres, pero también las distribuciones cruzadas que abarcan varios atributos, como la proporción de mujeres de 35 a 44 años, o la de esas mujeres residentes en Île-de-France. Este enfoque no pretende reconstituir perfectamente una población real a partir de datos parciales. Permite en cambio controlar explícitamente las propiedades estadísticas juzgadas importantes, y asegurar que la generación a gran escala respeta las medias generales produciendo al mismo tiempo combinaciones de atributos coherentes y muy poco sesgadas.

La sociología cuantitativa. Nuestros datos de calibración.

Heredamos las metodologías de construcción de poblaciones estadísticamente coherentes: INSEE a nivel IRIS para las poblaciones territoriales, datos sectoriales publicados por las autoridades de regulación, encuestas nacionales y europeas de referencia, paneles sectoriales de largo plazo. Estos datos públicos constituyen las restricciones que nuestras poblaciones sintéticas deben satisfacer. Nuestra aportación no es cuestionar esas fuentes: es combinarlas rigurosamente a una escala que los paneles físicos no pueden alcanzar.

Los estudios cualitativos por entrevista. Nuestra profundidad de interrogación.

Heredamos las metodologías de la entrevista cualitativa en profundidad: las de los investigadores en ciencias sociales que excavan las motivaciones profundas mediante la repregunta contextualizada, las de los clínicos que distinguen lo declarativo del síntoma, las de los etnógrafos que entran en los registros y los códigos de las poblaciones estudiadas. Esta tradición, que ha producido los insights más finos de las ciencias humanas, nos da la profundidad cualitativa sobre la que se calibran nuestros agentes dinámicos.

La ingeniería de los LLMs. Nuestra capa de ejecución.

Heredamos los avances recientes en modelos de lenguaje de gran tamaño: capacidad de diálogo contextualizado, comprensión fina de los registros lingüísticos, restitución estructurada, paralelización masiva de los tratamientos. Esta tradición, más reciente pero densa en progresos, hace posible la ejecución a gran escala de las entrevistas cualitativas sobre nuestras poblaciones sintéticas. Es nuestra capa de ejecución: no nuestra base científica. La distinción es importante: la IA genérica produce respuestas medias, nuestro sistema produce entrevistas cualitativas en profundidad sobre poblaciones con propiedades estadísticas explícitamente controladas.

LA BASE MATEMÁTICA

El Maximum Entropy Relaxation, nuestro método de generación bajo restricciones.

El problema.

Generar una población sintética coherente a la escala de varios millones de individuos que satisfaga simultáneamente de decenas a centenares de restricciones estadísticas multidimensionales no es un problema anodino. Es un problema NP-hard en informática teórica. Las formulaciones exactas explotan combinatoriamente en cuanto el número y la aridad de las restricciones aumentan. Una población generada por simple sampling a partir de distribuciones marginales respeta las medias generales pero viola sistemáticamente las correlaciones multidimensionales: los hombres directivos de 45 a 54 años residentes en Occitania quedan sobrerrepresentados o infrarrepresentados respecto a la realidad estadística, sin que nada en el sistema lo detecte.

El principio.

Resolvemos este problema mediante el Maximum Entropy Relaxation, un principio fundacional heredado de la física estadística y formalizado por Jaynes en 1957. La idea es matemáticamente simple y profunda: entre todas las distribuciones que satisfacen las restricciones conocidas, seleccionar la que hace menos hipótesis suplementarias: la distribución de entropía máxima. Esta distribución es máximamente no sesgada dadas las restricciones impuestas. Es única. Es matemáticamente óptima en el sentido preciso de la teoría de la información.

La formalización.

Nuestro enfoque reformula el problema NP-hard de la satisfacción exacta de las restricciones en un problema de optimización convexa resoluble por métodos numéricos estándar. Las restricciones multidimensionales se satisfacen en esperanza en lugar de exactamente, lo que produce una distribución de familia exponencial estándar sobre las configuraciones completas de la población. Esta formulación se dualiza en un problema de optimización convexa sobre los multiplicadores de Lagrange: resoluble por L-BFGS con garantías de convergencia.

El resultado.

Las propiedades estadísticas de nuestras poblaciones se controlan explícitamente y se verifican mediante la medida: las desviaciones respecto a las distribuciones objetivo, marginales, binarias y ternarias, se documentan para cada simulación en un informe de calibración anexado al expediente de investigación, y se publican en benchmarks estandarizados. Es lo que nos distingue de los actores que generan poblaciones por simple prompting de LLM. Un LLM librado a sí mismo tiene una deriva estructural: promedia. Produce para cada perfil el individuo más probable y aplasta la varianza interna de los grupos: las combinaciones raras y las voces minoritarias desaparecen, precisamente lo que la decisión necesita ver. Esta deriva es invisible a ojo, porque cada individuo parece plausible; es la población entera la que es falsa. El Maximum Entropy hace mecánicamente lo inverso: entre todas las distribuciones compatibles con las referencias, retiene la más extendida, la que no añade ningún estereotipo a las restricciones. La generación bajo restricciones mantiene la diversidad real en las frecuencias de referencia, y la medida de desviación permite a un tercero verificarlo.

Esta base matemática se presenta en detalle en el artículo Maximum Entropy Relaxation of Multi-Way Cardinality Constraints for Synthetic Population Generation, publicado en ArXiv en abril de 2026. El conjunto de las publicaciones científicas a las que contribuye nuestro equipo es accesible desde la página Papeles científicos.

CÓMO TRABAJAMOS CONCRETAMENTE

Cinco principios estructurantes que articulan la base matemática con la práctica.

Calibración sistemática sobre datos públicos y propietarios.

Cada población sintética se calibra sobre los datos públicos pertinentes para la decisión estudiada: INSEE a nivel IRIS para las poblaciones territoriales, datos sectoriales publicados por las autoridades de regulación, encuestas nacionales y europeas de referencia. Cuando el cliente dispone de datos propietarios pertinentes, estos se integran en la calibración tras una anonimización estricta para precisar la estructuración de las restricciones. Esta doble calibración produce las restricciones estadísticas multidimensionales que nuestra base matemática va a satisfacer.

Generación bajo restricciones multidimensionales por Maximum Entropy.

Una vez definidas las restricciones, nuestro sistema genera la población sintética por Maximum Entropy Relaxation, y mide después sus desviaciones respecto a las distribuciones objetivo, marginales unitarias, binarias y ternarias, documentadas en el informe de calibración. Nuestras poblaciones respetan simultáneamente las grandes medias demográficas y las correlaciones finas entre atributos: no solo las proporciones generales, sino las distribuciones cruzadas que estructuran la realidad sociológica.

Estructuración en tipologías granulares por cruce multidimensional.

Sobre esta base estadísticamente controlada, estructuramos la población en tipologías granulares, típicamente de 10 a 30 por simulación según la complejidad del caso, construidas por cruce de varias dimensiones pertinentes para la decisión estudiada. Esta estructuración se valida por referencia cruzada con los estudios cualitativos públicos sobre el tema, garantizando que las tipologías retenidas corresponden a cortes sociológicamente pertinentes y no a artefactos estadísticos.

Protocolos de entrevista estructurados con repregunta contextualizada.

Nuestros agentes dinámicos no plantean cuestionarios cerrados. Conducen entrevistas cualitativas estructuradas según protocolos calibrados para la decisión estudiada, con una capacidad de repregunta contextualizada que excava los puntos de fricción identificados en tiempo real. El número de repreguntas por entrevista, típicamente de 7 a 12 con picos de 20 a 30 en los casos más complejos, es un parámetro metodológico explícito, adaptado a la profundidad cualitativa requerida por cada simulación.

Trazabilidad integral de los razonamientos.

Cada insight restituido al cliente es trazable hasta las entrevistas individuales que lo produjeron. Cada proyección se apoya en los caminos de razonamiento que la construyeron. Esta trazabilidad integral no es una funcionalidad: es una exigencia metodológica. Garantiza que nuestros resultados son impugnables línea a línea por terceros independientes, lo que es la condición de existencia de un enfoque científico serio.

CÓMO NOS POSICIONAMOS

Respecto a las tradiciones que heredamos y a los actores competidores.

Paneles y sociología cuantitativa clásicaSimulación por LLM sin base matemáticaNuestra disciplina
Escala de interrogaciónPaneles de algunos miles de individuos entrevistadosPoblaciones generadas sin control de coherencia a escalaPoblaciones sintéticas coherentes hasta varios millones
Coherencia estadística multidimensionalDistribuciones marginales respetadas por muestreoDeriva hacia la media: ninguna propiedad controlada ni medidaPropiedades controladas y desviaciones medidas por Maximum Entropy Relaxation
Profundidad cualitativaLimitada a los cuestionarios estructuradosRespuestas medias sin repregunta contextualizadaEntrevistas en profundidad con 7 a 12 repreguntas por persona
Dimensión temporalFotografías sucesivas mediante campos repetidosRestitución instantánea sin profundidad temporalTrayectorias proyectadas a varios meses o años
Publicación científica del métodoMetodología sectorial documentada en las revistas clásicasAusente o limitada a las publicaciones comercialesPublicaciones ArXiv, Frontiers in AI, alianzas académicas

SALUD

SALUD

Relanzamiento de la cobertura vacunal de la triple vírica en doce territorios rezagados.

Este caso ilustra nuestro enfoque metodológico en su versión más legible. Generamos por Maximum Entropy una población sintética de 2,4 millones de padres de niños de 12 a 24 meses, que satisface simultáneamente las distribuciones marginales, binarias y ternarias calibradas sobre los datos del INSEE y de Santé publique France. Esta población se estructuró en 18 tipologías de reticencia vacunal construidas por cruce de seis dimensiones: la experiencia personal de la asistencia sanitaria, la confianza institucional, el capital cultural científico, el entorno familiar, la exposición mediática, el contexto territorial político. Nuestros agentes dinámicos condujeron varios centenares de miles de entrevistas sintéticas, con una media de 8 repreguntas por persona y una trazabilidad integral de cada insight hasta las entrevistas que lo produjeron.

Leer el caso completo →

LO QUE NO HACEMOS

Nuestra disciplina tiene un perímetro. Nombrarlo es un requisito previo del rigor científico.

Todo enfoque científico serio comienza por circunscribir su perímetro de aplicación. Los actores que pretenden explicarlo todo, predecirlo todo, resolverlo todo son estructuralmente menos creíbles que los que reconocen sus límites. Nosotros identificamos tres, estructurales en nuestra disciplina.

Nuestras poblaciones sintéticas no predicen mecánicamente el futuro.

Proyectan trayectorias posibles sobre la base de las dinámicas identificadas en las entrevistas y de las cascadas modelizadas. Estas proyecciones son probabilísticas, no deterministas. Reducen la incertidumbre antes de la decisión: no la anulan. Un acontecimiento exógeno inesperado (una crisis económica, un choque geopolítico, un acontecimiento mediático disruptivo) puede invalidar una proyección sea cual sea el cuidado aportado a su construcción.

Nuestras simulaciones no sustituyen a los datos reales.

Cuando existen datos de comportamiento reales disponibles y pertinentes para la decisión, siguen siendo la referencia: nuestras simulaciones los completan, no los sustituyen. Nuestras poblaciones sintéticas despliegan todo su valor cuando los datos reales no existen todavía (un nuevo producto, un nuevo territorio, una nueva configuración) o no bastan (comportamientos bajo escenarios no observados).

Nuestras proyecciones no dispensan de la decisión humana.

Restituimos insights, escenarios comparados, puntos de inflexión identificados. No tomamos la decisión en lugar del decisor. Nuestros entregables son instrumentos de exploración que acompañan el razonamiento del dirigente: no lo sustituyen. Esta distinción es esencial: una organización que delegara sus decisiones en un sistema de simulación, cualquiera que fuese, cometería una falta metodológica y política mayor. Nuestras herramientas aumentan la lucidez del decisor: no reemplazan su responsabilidad.

Une décision à prendre, une population de synthèse qui y répond, un éclairage

¿Desea profundizar en nuestro enfoque científico?

Nuestros controles metodológicos y nuestros protocolos de validación se detallan en la página Validación y calibración. Los benchmarks científicos que comparan nuestro enfoque con los métodos clásicos se publican en la página Benchmarks. Las publicaciones científicas a las que contribuye nuestro equipo son accesibles desde la página Papeles científicos. François Pachet cofundador y nuestro ecosistema de alianzas académicas se presentan en la página dedicada. También puede contactar directamente con nuestro equipo para hablar de los parámetros metodológicos de una simulación adaptada a su decisión.

Ver los benchmarks →