CIENCIA · FUNDAMENTOS METODOLÓGICOS
Nuestras poblaciones sintéticas no se simulan por LLM ni se calibran a ojo. Se generan bajo restricciones estadísticas multidimensionales, con propiedades explícitamente controladas y desviaciones respecto a las referencias medidas y publicadas.
DE DÓNDE VENIMOS CIENTÍFICAMENTE
No inventamos una metodología ex nihilo. Articulamos cuatro tradiciones científicas establecidas en una combinación inédita. Cada una aporta un ladrillo específico. Juntas producen lo que ninguna podía producir por separado: la inteligencia de decisiones por población sintética.
Imagine All The People combina métodos de satisfacción de restricciones, heredados de los trabajos de Régin (1996) sobre la Global Cardinality Constraint, y métodos de modelización probabilística, heredados del principio de Maximum Entropy formalizado por Jaynes (1957). El objetivo es construir poblaciones sintéticas coherentes con un conjunto de estadísticas de referencia: las distribuciones marginales, por ejemplo el 52 % de mujeres, pero también las distribuciones cruzadas que abarcan varios atributos, como la proporción de mujeres de 35 a 44 años, o la de esas mujeres residentes en Île-de-France. Este enfoque no pretende reconstituir perfectamente una población real a partir de datos parciales. Permite en cambio controlar explícitamente las propiedades estadísticas juzgadas importantes, y asegurar que la generación a gran escala respeta las medias generales produciendo al mismo tiempo combinaciones de atributos coherentes y muy poco sesgadas.
Heredamos las metodologías de construcción de poblaciones estadísticamente coherentes: INSEE a nivel IRIS para las poblaciones territoriales, datos sectoriales publicados por las autoridades de regulación, encuestas nacionales y europeas de referencia, paneles sectoriales de largo plazo. Estos datos públicos constituyen las restricciones que nuestras poblaciones sintéticas deben satisfacer. Nuestra aportación no es cuestionar esas fuentes: es combinarlas rigurosamente a una escala que los paneles físicos no pueden alcanzar.
Heredamos las metodologías de la entrevista cualitativa en profundidad: las de los investigadores en ciencias sociales que excavan las motivaciones profundas mediante la repregunta contextualizada, las de los clínicos que distinguen lo declarativo del síntoma, las de los etnógrafos que entran en los registros y los códigos de las poblaciones estudiadas. Esta tradición, que ha producido los insights más finos de las ciencias humanas, nos da la profundidad cualitativa sobre la que se calibran nuestros agentes dinámicos.
Heredamos los avances recientes en modelos de lenguaje de gran tamaño: capacidad de diálogo contextualizado, comprensión fina de los registros lingüísticos, restitución estructurada, paralelización masiva de los tratamientos. Esta tradición, más reciente pero densa en progresos, hace posible la ejecución a gran escala de las entrevistas cualitativas sobre nuestras poblaciones sintéticas. Es nuestra capa de ejecución: no nuestra base científica. La distinción es importante: la IA genérica produce respuestas medias, nuestro sistema produce entrevistas cualitativas en profundidad sobre poblaciones con propiedades estadísticas explícitamente controladas.
LA BASE MATEMÁTICA
Generar una población sintética coherente a la escala de varios millones de individuos que satisfaga simultáneamente de decenas a centenares de restricciones estadísticas multidimensionales no es un problema anodino. Es un problema NP-hard en informática teórica. Las formulaciones exactas explotan combinatoriamente en cuanto el número y la aridad de las restricciones aumentan. Una población generada por simple sampling a partir de distribuciones marginales respeta las medias generales pero viola sistemáticamente las correlaciones multidimensionales: los hombres directivos de 45 a 54 años residentes en Occitania quedan sobrerrepresentados o infrarrepresentados respecto a la realidad estadística, sin que nada en el sistema lo detecte.
Resolvemos este problema mediante el Maximum Entropy Relaxation, un principio fundacional heredado de la física estadística y formalizado por Jaynes en 1957. La idea es matemáticamente simple y profunda: entre todas las distribuciones que satisfacen las restricciones conocidas, seleccionar la que hace menos hipótesis suplementarias: la distribución de entropía máxima. Esta distribución es máximamente no sesgada dadas las restricciones impuestas. Es única. Es matemáticamente óptima en el sentido preciso de la teoría de la información.
Nuestro enfoque reformula el problema NP-hard de la satisfacción exacta de las restricciones en un problema de optimización convexa resoluble por métodos numéricos estándar. Las restricciones multidimensionales se satisfacen en esperanza en lugar de exactamente, lo que produce una distribución de familia exponencial estándar sobre las configuraciones completas de la población. Esta formulación se dualiza en un problema de optimización convexa sobre los multiplicadores de Lagrange: resoluble por L-BFGS con garantías de convergencia.
Las propiedades estadísticas de nuestras poblaciones se controlan explícitamente y se verifican mediante la medida: las desviaciones respecto a las distribuciones objetivo, marginales, binarias y ternarias, se documentan para cada simulación en un informe de calibración anexado al expediente de investigación, y se publican en benchmarks estandarizados. Es lo que nos distingue de los actores que generan poblaciones por simple prompting de LLM. Un LLM librado a sí mismo tiene una deriva estructural: promedia. Produce para cada perfil el individuo más probable y aplasta la varianza interna de los grupos: las combinaciones raras y las voces minoritarias desaparecen, precisamente lo que la decisión necesita ver. Esta deriva es invisible a ojo, porque cada individuo parece plausible; es la población entera la que es falsa. El Maximum Entropy hace mecánicamente lo inverso: entre todas las distribuciones compatibles con las referencias, retiene la más extendida, la que no añade ningún estereotipo a las restricciones. La generación bajo restricciones mantiene la diversidad real en las frecuencias de referencia, y la medida de desviación permite a un tercero verificarlo.
Esta base matemática se presenta en detalle en el artículo Maximum Entropy Relaxation of Multi-Way Cardinality Constraints for Synthetic Population Generation, publicado en ArXiv en abril de 2026. El conjunto de las publicaciones científicas a las que contribuye nuestro equipo es accesible desde la página Papeles científicos.
CÓMO TRABAJAMOS CONCRETAMENTE
Cada población sintética se calibra sobre los datos públicos pertinentes para la decisión estudiada: INSEE a nivel IRIS para las poblaciones territoriales, datos sectoriales publicados por las autoridades de regulación, encuestas nacionales y europeas de referencia. Cuando el cliente dispone de datos propietarios pertinentes, estos se integran en la calibración tras una anonimización estricta para precisar la estructuración de las restricciones. Esta doble calibración produce las restricciones estadísticas multidimensionales que nuestra base matemática va a satisfacer.
Una vez definidas las restricciones, nuestro sistema genera la población sintética por Maximum Entropy Relaxation, y mide después sus desviaciones respecto a las distribuciones objetivo, marginales unitarias, binarias y ternarias, documentadas en el informe de calibración. Nuestras poblaciones respetan simultáneamente las grandes medias demográficas y las correlaciones finas entre atributos: no solo las proporciones generales, sino las distribuciones cruzadas que estructuran la realidad sociológica.
Sobre esta base estadísticamente controlada, estructuramos la población en tipologías granulares, típicamente de 10 a 30 por simulación según la complejidad del caso, construidas por cruce de varias dimensiones pertinentes para la decisión estudiada. Esta estructuración se valida por referencia cruzada con los estudios cualitativos públicos sobre el tema, garantizando que las tipologías retenidas corresponden a cortes sociológicamente pertinentes y no a artefactos estadísticos.
Nuestros agentes dinámicos no plantean cuestionarios cerrados. Conducen entrevistas cualitativas estructuradas según protocolos calibrados para la decisión estudiada, con una capacidad de repregunta contextualizada que excava los puntos de fricción identificados en tiempo real. El número de repreguntas por entrevista, típicamente de 7 a 12 con picos de 20 a 30 en los casos más complejos, es un parámetro metodológico explícito, adaptado a la profundidad cualitativa requerida por cada simulación.
Cada insight restituido al cliente es trazable hasta las entrevistas individuales que lo produjeron. Cada proyección se apoya en los caminos de razonamiento que la construyeron. Esta trazabilidad integral no es una funcionalidad: es una exigencia metodológica. Garantiza que nuestros resultados son impugnables línea a línea por terceros independientes, lo que es la condición de existencia de un enfoque científico serio.
CÓMO NOS POSICIONAMOS
| Paneles y sociología cuantitativa clásica | Simulación por LLM sin base matemática | Nuestra disciplina | |
|---|---|---|---|
| Escala de interrogación | Paneles de algunos miles de individuos entrevistados | Poblaciones generadas sin control de coherencia a escala | Poblaciones sintéticas coherentes hasta varios millones |
| Coherencia estadística multidimensional | Distribuciones marginales respetadas por muestreo | Deriva hacia la media: ninguna propiedad controlada ni medida | Propiedades controladas y desviaciones medidas por Maximum Entropy Relaxation |
| Profundidad cualitativa | Limitada a los cuestionarios estructurados | Respuestas medias sin repregunta contextualizada | Entrevistas en profundidad con 7 a 12 repreguntas por persona |
| Dimensión temporal | Fotografías sucesivas mediante campos repetidos | Restitución instantánea sin profundidad temporal | Trayectorias proyectadas a varios meses o años |
| Publicación científica del método | Metodología sectorial documentada en las revistas clásicas | Ausente o limitada a las publicaciones comerciales | Publicaciones ArXiv, Frontiers in AI, alianzas académicas |
SALUD
SALUD
Este caso ilustra nuestro enfoque metodológico en su versión más legible. Generamos por Maximum Entropy una población sintética de 2,4 millones de padres de niños de 12 a 24 meses, que satisface simultáneamente las distribuciones marginales, binarias y ternarias calibradas sobre los datos del INSEE y de Santé publique France. Esta población se estructuró en 18 tipologías de reticencia vacunal construidas por cruce de seis dimensiones: la experiencia personal de la asistencia sanitaria, la confianza institucional, el capital cultural científico, el entorno familiar, la exposición mediática, el contexto territorial político. Nuestros agentes dinámicos condujeron varios centenares de miles de entrevistas sintéticas, con una media de 8 repreguntas por persona y una trazabilidad integral de cada insight hasta las entrevistas que lo produjeron.
Leer el caso completo →LO QUE NO HACEMOS
Todo enfoque científico serio comienza por circunscribir su perímetro de aplicación. Los actores que pretenden explicarlo todo, predecirlo todo, resolverlo todo son estructuralmente menos creíbles que los que reconocen sus límites. Nosotros identificamos tres, estructurales en nuestra disciplina.
Proyectan trayectorias posibles sobre la base de las dinámicas identificadas en las entrevistas y de las cascadas modelizadas. Estas proyecciones son probabilísticas, no deterministas. Reducen la incertidumbre antes de la decisión: no la anulan. Un acontecimiento exógeno inesperado (una crisis económica, un choque geopolítico, un acontecimiento mediático disruptivo) puede invalidar una proyección sea cual sea el cuidado aportado a su construcción.
Cuando existen datos de comportamiento reales disponibles y pertinentes para la decisión, siguen siendo la referencia: nuestras simulaciones los completan, no los sustituyen. Nuestras poblaciones sintéticas despliegan todo su valor cuando los datos reales no existen todavía (un nuevo producto, un nuevo territorio, una nueva configuración) o no bastan (comportamientos bajo escenarios no observados).
Restituimos insights, escenarios comparados, puntos de inflexión identificados. No tomamos la decisión en lugar del decisor. Nuestros entregables son instrumentos de exploración que acompañan el razonamiento del dirigente: no lo sustituyen. Esta distinción es esencial: una organización que delegara sus decisiones en un sistema de simulación, cualquiera que fuese, cometería una falta metodológica y política mayor. Nuestras herramientas aumentan la lucidez del decisor: no reemplazan su responsabilidad.
Nuestros controles metodológicos y nuestros protocolos de validación se detallan en la página Validación y calibración. Los benchmarks científicos que comparan nuestro enfoque con los métodos clásicos se publican en la página Benchmarks. Las publicaciones científicas a las que contribuye nuestro equipo son accesibles desde la página Papeles científicos. François Pachet cofundador y nuestro ecosistema de alianzas académicas se presentan en la página dedicada. También puede contactar directamente con nuestro equipo para hablar de los parámetros metodológicos de una simulación adaptada a su decisión.
Ver los benchmarks →