GUÍAS · METODOLOGÍA

Cómo crear una población sintética: la guía metodológica.

Una población sintética no es una colección de personas generadas por un LLM. Es un objeto estadístico construido bajo restricciones, con propiedades controladas y desviaciones medidas. Esta guía describe las seis etapas de una creación rigurosa.

DEFINICIÓN

¿Qué es una población sintética?

Una población sintética es un conjunto de individuos modelizados, de algunos miles a varios millones, que reproduce las propiedades estadísticas de una población real sin contener ningún dato personal. Cada individuo porta atributos demográficos, económicos, de comportamiento, territoriales y culturales, coherentes entre sí y coherentes a la escala del conjunto.

La distinción con los objetos vecinos es estructurante. Un buyer persona es un retrato robot: una media encarnada, sin varianza interna. Un panel es una muestra de personas reales: valiosa, pero limitada en tamaño, en granularidad y en disponibilidad. Una población sintética combina la escala que el panel no alcanza y la diversidad interna que el persona aplasta. Se reconstruye a partir de agregados anónimos y de segmentos: ningún dato nominativo entra en el sistema, lo que la hace nativamente conforme con el RGPD.

LA TRAMPA DEL LLM SOLO

¿Por qué no basta con pedir perfiles a un LLM?

Es el método más extendido, y es el más engañoso. Un LLM librado a sí mismo tiene una deriva estructural: promedia. Para cada perfil solicitado, produce el individuo más probable y aplasta la varianza interna de los grupos. Las combinaciones raras y las voces minoritarias desaparecen: precisamente lo que la decisión necesita ver. Esta deriva es invisible a ojo, porque cada individuo tomado aisladamente parece plausible. Es la población entera la que es falsa.

La generación bajo restricciones hace mecánicamente lo inverso. Entre todas las distribuciones compatibles con las referencias estadísticas impuestas, retiene la más extendida, la que no añade ningún estereotipo a las restricciones. La diversidad real se mantiene en las frecuencias de referencia, y la medida de las desviaciones permite a un tercero verificarlo. Es la diferencia entre una intuición disfrazada y un objeto científico.

ETAPA 1

Delimitar el perímetro decisional.

Una población sintética se construye para una decisión, no en abstracto. La primera etapa consiste en formular la decisión que hay que iluminar, y deducir de ella las poblaciones pertinentes: quién vive el impacto de esa decisión, en qué territorio, a qué horizonte. Una subida tarifaria no moviliza las mismas poblaciones que una reforma reglamentaria o que un lanzamiento de producto. Este encuadre determina las dimensiones que hay que modelizar y condiciona la calidad de todo lo que sigue.

ETAPA 2

Reunir los datos de calibración.

La calibración se apoya en dos familias de fuentes. Los datos públicos primero: los censos de malla fina, como los datos del INSEE a nivel IRIS para las poblaciones territoriales francesas, los datos sectoriales publicados por las autoridades de regulación, las encuestas nacionales y europeas de referencia. Los datos propietarios después, cuando la organización dispone de ellos: tipologías internas, historiales de comportamiento, segmentaciones propias, integradas tras una anonimización estricta. Esta doble calibración produce la materia prima de la etapa siguiente: las referencias estadísticas que la población deberá satisfacer.

ETAPA 3

Formalizar las restricciones estadísticas.

Las referencias se traducen en restricciones de tres niveles. Las distribuciones marginales portan sobre un atributo aislado: el 52 % de mujeres. Las restricciones binarias cruzan dos atributos: la proporción de mujeres de 35 a 44 años. Las restricciones ternarias cruzan tres: la proporción de hombres directivos de 45 a 54 años residentes en una región dada. Son estas restricciones multidimensionales las que hacen la realidad sociológica de una población. Una generación que solo respeta las marginales produce medias justas y cruces falsos, sin que nada lo señale. Una simulación real moviliza típicamente de 30 a 60 atributos cruzados, con numerosas restricciones ternarias.

ETAPA 4

Generar bajo restricciones.

Satisfacer simultáneamente de decenas a centenares de restricciones multidimensionales a la escala de millones de individuos es un problema NP-hard: las formulaciones exactas explotan combinatoriamente. La respuesta metodológica es el Maximum Entropy Relaxation, heredado del principio formalizado por Jaynes en 1957 y de los trabajos de Régin sobre las restricciones de cardinalidad: entre todas las distribuciones que satisfacen las restricciones, retener la de entropía máxima, la menos sesgada, que es única y óptima en el sentido de la teoría de la información. El problema se reformula en optimización convexa, resoluble con garantías de convergencia.

Este enfoque está benchmarkeado públicamente frente al generalized raking, el método de referencia de las encuestas estadísticas, sobre conjuntos de datos NPORS de 4 a 40 atributos con restricciones ternarias. Más allá de 28 atributos simultáneos, su ventaja es estructural: ese es el régimen de las simulaciones reales. Los resultados, el código y la metodología están publicados en ArXiv y son reproducibles por terceros.

ETAPA 5

Estructurar en tipologías granulares.

Una población estadísticamente justa permanece ilegible sin estructuración. La etapa siguiente la divide en tipologías granulares, típicamente de 10 a 30 por simulación, construidas por cruce de las dimensiones pertinentes para la decisión: relación con el tema, trayectoria personal, anclaje territorial, exposición mediática, capital cultural. Estas tipologías se validan por referencia cruzada con los estudios cualitativos públicos sobre el tema, para garantizar que corresponden a cortes sociológicamente pertinentes y no a artefactos estadísticos. Es a esta malla donde se juega la decisión: las medias generales esconden el 4 % de una población que concentra el 78 % del riesgo de una medida.

ETAPA 6

Validar, medir, documentar.

Una población sintética seria se entrega con sus pruebas. Las desviaciones respecto a las distribuciones objetivo, marginales, binarias y ternarias, se miden y se documentan en un informe de calibración. La varianza interna se compara con las referencias de encuestas. Los resultados producidos sobre la población deben ser trazables hasta las entrevistas individuales que los fundan, y por tanto impugnables línea a línea por terceros independientes. Una población cuyas propiedades no se miden ni se publican no es un objeto metodológico: es una hipótesis disfrazada.

LÍMITES ASUMIDOS

Lo que una población sintética no permite.

Tres límites delimitan el uso. No predice mecánicamente el futuro: proyecta trayectorias probabilísticas que reducen la incertidumbre sin anularla. No sustituye a los datos reales: cuando existen datos de comportamiento observados y pertinentes, siguen siendo la referencia que la simulación completa. No dispensa de la decisión humana: ilumina el razonamiento del decisor, no se sustituye a él. Nombrar estos límites es un requisito previo del rigor científico.

FAQ

Preguntas frecuentes.

¿Cuántos individuos hay que generar?

La escala se calibra sobre la decisión: de algunos centenares de miles de individuos para un territorio o un segmento a diez millones para una población multinacional. El reto no es el volumen bruto sino la preservación de la granularidad: las tipologías minoritarias deben permanecer representadas en sus frecuencias reales.

¿Una población sintética contiene datos personales?

No, por construcción. Se genera a partir de agregados anónimos y de estadísticas públicas o propietarias anonimizadas. Ningún dato nominativo entra en el sistema, lo que la hace nativamente compatible con el RGPD.

¿Qué diferencia hay con un panel clásico?

El panel entrevista a personas reales, en número limitado y con plazos largos. La población sintética alcanza una escala y una granularidad inaccesibles para el panel, con una disponibilidad inmediata. Los dos enfoques son complementarios: los estudios estructurantes conservan su valor en panel, las exploraciones iterativas pasan a lo sintético.

¿Se pueden utilizar segmentaciones propias?

Sí. Los segmentos propietarios de una organización se formalizan en instrucciones de instanciación: la población generada respeta entonces simultáneamente las referencias públicas y la segmentación propia, que sigue siendo propiedad de la organización.

¿Cuánto tiempo lleva la creación?

En nuestro sistema, la generación de una población calibrada y su interrogación se cuentan en minutos: del brief inicial al primer expediente de investigación, cuente entre 20 y 30 minutos según la complejidad del caso.

Une décision à prendre, une population de synthèse qui y répond, un éclairage

Crear su primera población.

La metodología descrita en esta guía está industrializada en nuestro sistema: describa la población que quiere comprender, en lenguaje natural, y conozca a los humanos sintéticos que la componen.

Contactar con nuestro equipo →

PARA IR MÁS LEJOS