Culturally Grounded Personas in Large Language Models: Characterization and Alignment with Socio-Psychological Value Frameworks

Sociedad, cultura y comportamiento colectivo2026arXivRevisión editorial aprobada

Autores: Candida M. Greco, Lucio La Cava, Andrea Tagarelli

Palabras clave: Large Language Models, Personality, Persona, Cultural Values, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
18
Hallazgos
49
Limitaciones
9
Evidencias

Resumen editorial

Español

Este preprint estudia si personas sintéticas construidas a partir de valores culturales producen respuestas que conservan estructura en el mapa de Inglehart–Welzel, se aproximan a distribuciones humanas del World Values Survey (WVS) y muestran patrones interpretables en Moral Foundations Theory. Esta revisión se basa en arXiv v2, revisado el 3 de junio de 2026, un PDF de 25 páginas que continúa marcado «Under Review»; no se encontró una publicación revisada por pares ni un repositorio oficial con código o datos.

Los autores definen diez variables categóricas derivadas de WVS-7: religiosidad, valores de crianza, aceptabilidad moral, confianza social, participación política, orgullo nacional, felicidad, igualdad de género, orientación materialista y tolerancia a la diversidad. El producto cartesiano de sus niveles genera 93.312 configuraciones. GPT-OSS-20B recibe una configuración y redacta una persona de 250–500 palabras con nombre, edad, género opcional, ocupación, país o región, biografía y una explicación explícita de cómo se manifiesta cada variable. El prompt prohíbe contradicciones y exige vincular cada frase del mapa cultural con la condición recibida. Por tanto, el corpus no es una muestra de personas o culturas observadas: es una enumeración equiprobable y diseñada de combinaciones, algunas raras o sociológicamente inverosímiles. Los propios metadatos generados están muy concentrados: 67,743 % de edades entre 30–39, 31,003 % entre 40–49, predominio de Norteamérica y Europa y 21,37 % de ocupaciones en educación y academia.

Para RQ1, el mismo modelo adopta cada persona y responde diez indicadores IVS/WVS usados para calcular coordenadas del mapa Inglehart–Welzel. Las 93.312 posiciones forman una nube sin clústeres claros. El método previsto de teselación de Voronoi se sustituye en resultados por una cuadrícula regular de lado 1; FPClose encuentra 735 itemsets cerrados en 111 celdas no vacías. Aparecen asociaciones espaciales entre felicidad, confianza, orgullo nacional, crianza, tolerancia y aceptabilidad moral. Es una descripción útil de la geometría inducida por el pipeline, pero la persona ya contiene de forma explícita las mismas variables que después se preguntan: el análisis mide sobre todo transmisión y coherencia interna del condicionamiento, no recuperación independiente de culturas humanas.

Para RQ2, GPT-OSS-20B vuelve a adoptar cada perfil, se autoasigna continente, entorno urbano/rural y educación, y responde 36 preguntas de WVB-Probe. Se comparan sus distribuciones con referencias humanas por triple demográfico mediante EMD. Entran 92.710 personas y 45 de 46 grupos. El artículo informa 1−EMD de 0,790 sin ponderar y 0,809 ponderado por el tamaño de los grupos sintéticos; 90,12 % y 94,25 % de las comparaciones, respectivamente, quedan por debajo de EMD 0,4, pero solo 56,96 % y 59,06 % quedan por debajo de 0,2. La cobertura es extremadamente desigual: Europa–urbano–terciario aporta 32.716 personas; junto con Norteamérica–urbano–terciario y Asia–urbano–terciario concentra 60.568 de 92.710 casos (65,3 %), mientras 13 grupos tienen menos de 100 personas y uno solo una. Las ponderaciones representan la demografía que inventa el modelo, no prevalencias humanas.

Para RQ3 se comparan dos representaciones morales igualmente sintéticas. La primera promedia las 36 respuestas MFQ-2 que GPT-OSS produce al representar a cada persona. La segunda asigna a los 32 valores culturales puntuaciones en seis fundamentos morales mediante un LLM «oráculo» y agrega los valores presentes en cada configuración. Se prueban Gemini 3 Pro, GPT-5.2, Claude Sonnet 4.5 y el modelo base, pero se elige Gemini 3 Pro porque genera más varianza; los demás dan puntuaciones cercanas a 2–3. Después, una selección greedy con corrección lineal busca subconjuntos de variables que aproximen las puntuaciones MFQ de GPT-OSS. Encuentra conjuntos estables y compactos para Lealtad, Autoridad y Pureza, orgullo nacional, religiosidad y otras variables afines, mientras Cuidado, Igualdad y Proporcionalidad muestran menos diferenciación. No hay respuestas humanas MFQ-2 que actúen como criterio externo: se alinea una construcción de un LLM con otra construcción de LLM y se selecciona post hoc el oráculo más variable.

Como comprobación entre modelos, Qwen3.5-9B se ejecuta sobre 300 configuraciones muestreadas uniformemente del espacio IW, con tres runs por configuración. El 57,33 % de los pares Qwen–GPT-OSS queda a distancia IW entre 0 y 1 y el 91,66 % entre 0 y 2; los mapas morales conservan cualitativamente más diferenciación en fundamentos vinculantes que individualizantes. El artículo no aporta correlaciones, intervalos, baseline nulo ni un umbral justificado para interpretar esas distancias, y la comparación moral se apoya principalmente en mapas visuales.

La contribución defendible es un marco exploratorio, transparente en sus prompts y explícito sobre varias limitaciones, para auditar qué estructura cultural y moral genera un LLM bajo condicionamiento controlado. Sus resultados respaldan coherencia y patrones distribucionales a nivel agregado dentro de ese sistema. No demuestran que las personas sean culturalmente auténticas, que representen individuos, países o grupos reales, ni que las respuestas morales sean válidas psicológica o interculturalmente. Sin artefactos, código, semillas, revisiones exactas de modelos y salidas publicadas, los cálculos y la reproducibilidad no pueden auditarse de extremo a extremo.

English

This preprint studies whether synthetic personas constructed from cultural values produce responses that preserve structure on the Inglehart–Welzel map, approximate human World Values Survey (WVS) distributions, and show interpretable Moral Foundations Theory patterns. This review uses arXiv v2, revised on 3 June 2026, a 25-page PDF that remains marked “Under Review”; no peer-reviewed publication or official code/data repository was found.

The authors define ten categorical variables derived from WVS-7: religiosity, child-rearing values, moral acceptability, social trust, political participation, national pride, happiness, gender equality, materialism orientation, and tolerance toward outgroups. The Cartesian product of their levels yields 93,312 configurations. GPT-OSS-20B receives one configuration and writes a 250–500-word persona with a name, age, optional gender, occupation, country or region, bio, and an explicit account of how each variable manifests. The prompt forbids contradictions and requires every cultural-mapping sentence to reference its conditioning variable. The resulting corpus is therefore not a sample of observed people or cultures: it is an equally weighted, designed enumeration of combinations, some rare or sociologically implausible. Generated metadata are highly concentrated: 67.743% of ages are 30–39, 31.003% are 40–49, North America and Europe dominate, and 21.37% of occupations are in education and academia.

For RQ1, the same model adopts every persona and answers ten IVS/WVS indicators used to compute Inglehart–Welzel coordinates. The 93,312 positions form a cloud with no clear clusters. The planned Voronoi tessellation is replaced in the results by a regular grid of side length 1; FPClose discovers 735 closed itemsets across 111 non-empty cells. Spatial associations emerge among happiness, trust, national pride, child rearing, tolerance, and moral acceptability. This usefully describes the geometry induced by the pipeline, but the persona already explicitly contains the variables later elicited: the analysis mainly measures transmission and internal consistency of the conditioning, not independent recovery of human cultures.

For RQ2, GPT-OSS-20B again adopts each profile, self-assigns a continent, urban/rural setting, and education level, and answers 36 WVB-Probe questions. Its distributions are compared with human references for each demographic triple using EMD. The analysis includes 92,710 personas and 45 of 46 groups. The paper reports 1−EMD of 0.790 unweighted and 0.809 weighted by synthetic group size; 90.12% and 94.25% of comparisons, respectively, fall below EMD 0.4, but only 56.96% and 59.06% fall below 0.2. Coverage is extremely uneven: Europe–urban–tertiary contributes 32,716 personas; together with North America–urban–tertiary and Asia–urban–tertiary it accounts for 60,568 of 92,710 cases (65.3%), while 13 groups contain fewer than 100 personas and one contains a single persona. The weights describe demographics invented by the model rather than human prevalence.

For RQ3, two equally synthetic moral representations are compared. The first averages the 36 MFQ-2 answers produced by GPT-OSS while role-playing each persona. The second asks an LLM “oracle” to score the 32 cultural-variable values on six moral foundations and aggregates the values present in each configuration. Gemini 3 Pro, GPT-5.2, Claude Sonnet 4.5, and the default model are tried, but Gemini 3 Pro is selected because it produces greater variance; the others return near-neutral scores of 2–3. A greedy selection procedure with a linear correction then seeks variable subsets that approximate GPT-OSS MFQ scores. It finds stable compact sets for Loyalty, Authority, and Purity, national pride, religiosity, and related variables, while Care, Equality, and Proportionality show less differentiation. There are no human MFQ-2 responses serving as an external criterion: one LLM construction is aligned with another, and the most variable oracle is selected post hoc.

As a cross-model check, Qwen3.5-9B is run on 300 configurations sampled uniformly from IW space, with three runs per configuration. 57.33% of Qwen–GPT-OSS pairs have an IW distance between 0 and 1 and 91.66% between 0 and 2; the moral maps qualitatively preserve greater differentiation for binding than individualizing foundations. The paper provides no correlations, uncertainty intervals, null baseline, or justified threshold for interpreting those distances, and the moral comparison relies mainly on visual maps.

The defensible contribution is an exploratory framework, transparent about its prompts and several limitations, for auditing the cultural and moral structure an LLM generates under controlled conditioning. The results support internal coherence and aggregate distributional patterns within that system. They do not demonstrate that the personas are culturally authentic, represent real individuals, countries, or groups, or yield psychologically or cross-culturally valid moral responses. Without released artifacts, code, seeds, exact model revisions, and outputs, the calculations and end-to-end reproducibility cannot be independently audited.

Pregunta de investigación

¿Qué estructura cultural proyectan 93.312 personas generadas al condicionar un LLM con combinaciones de diez variables WVS, hasta qué punto sus respuestas agregadas a WVB-Probe se aproximan a distribuciones humanas por grupo demográfico y cómo se relacionan sus respuestas MFQ-2 con un mapeo LLM de variables culturales a fundamentos morales?

Método

Preprint arXiv v2. Se enumeran las 93.312 combinaciones del producto cartesiano de diez variables categóricas derivadas de WVS-7 y GPT-OSS-20B genera una persona por combinación. RQ1: el modelo responde diez indicadores IVS, se calculan coordenadas Inglehart–Welzel y se minan itemsets cerrados con FPClose sobre una cuadrícula. RQ2: el modelo genera un triple demográfico y responde 36 ítems WVB-Probe; las distribuciones de 92.710 personas y 45 grupos se comparan con referencias humanas mediante EMD. RQ3: se comparan puntuaciones MFQ-2 de GPT-OSS con puntuaciones de variables culturales producidas por un oráculo LLM; una selección greedy con corrección lineal se repite 50 veces. Qwen3.5-9B replica análisis IW y moral en 300 configuraciones, tres runs por caso. Temperatura 1,0 y top_p 1,0; no se publican código, datos ni semillas.

Muestra: Corpus sintético exhaustivo de 93.312 configuraciones equiprobables, no una muestra humana. Para WVB-Probe entran 92.710 perfiles y 45 de 46 triples demográficos; los tres grupos mayores concentran 60.568 casos (65,3 %) y 13 grupos tienen menos de 100. Qwen se evalúa en 300 configuraciones con tres runs. La revisión experta de personas se describe como una muestra estratificada de extremos, ejes, centro y regiones, pero no se informa su tamaño, selección exacta, protocolo ni acuerdo.

Hallazgos

  • Las 93.312 posiciones IW forman una nube elíptica ligeramente inclinada, sin una estructura clara de clústeres.
  • Al no emerger clústeres, el análisis sustituye la teselación de Voronoi propuesta por una cuadrícula regular de lado 1.
  • FPClose identifica 735 itemsets cerrados en 111 celdas no vacías del mapa IW.
  • Felicidad alta y confianza alta aparecen juntas en 21 celdas con soporte medio 0,735; felicidad mínima y desconfianza en 15 celdas con soporte medio 0,806.
  • La persona base sin condicionamiento queda en el cuadrante secular y de autoexpresión, mientras las personas condicionadas ocupan una región más amplia.
  • RQ2 cubre 92.710 de 93.312 personas y 45 de 46 grupos demográficos con referencia humana.
  • La alineación WVB-Probe agregada es 1−EMD 0,790 sin ponderar y 0,809 ponderada por el tamaño de los grupos sintéticos.
  • El 90,12 % sin ponderar y 94,25 % ponderado de preguntas queda por debajo de EMD 0,4; solo 56,96 % y 59,06 % queda por debajo de 0,2.
  • Las puntuaciones de grupo abarcan 0,628–0,840 y algunos grupos tienen tamaños demasiado pequeños para una distribución estable.
  • Europa–urbano–terciario es el grupo mayor con 32.716 perfiles y menor fracción de preguntas con EMD <0,2 que Norteamérica o Asia con el mismo entorno y educación.
  • El mapeo moral uniforme de las diez variables difiere en escala y tendencia de las respuestas MFQ-2, lo que motiva la selección posterior de subconjuntos.
  • Gemini 3 Pro se elige como oráculo moral porque sus puntuaciones varían más; los otros modelos probados tienden a 2–3.
  • La selección greedy produce conjuntos siempre seleccionados para Proporcionalidad (materialismo), Lealtad (orgullo nacional), Autoridad (cinco variables) y Pureza (religiosidad).
  • Cuidado e Igualdad muestran selección menos estable: Jaccard medio 0,669 y 0,738, respectivamente.
  • Las asociaciones son más fuertes para Lealtad, Autoridad y Pureza que para Cuidado, Igualdad y Proporcionalidad.
  • En 300 casos, 172 pares Qwen–GPT-OSS (57,33 %) quedan a distancia IW ≤1 y 275 (91,66 %) a distancia ≤2.
  • Los mapas Qwen conservan cualitativamente el contraste entre fundamentos vinculantes e individualizantes observado con GPT-OSS.
  • La evidencia demuestra regularidades del pipeline bajo prompts explícitos; no aporta una validación externa de autenticidad cultural individual.

Limitaciones

  • El trabajo sigue marcado Under Review y no se encontró una versión revisada por pares.
  • Los artefactos se prometen solo tras aceptación y no están publicados en el momento de esta revisión.
  • No hay repositorio oficial de código, dataset generado, salidas crudas ni scripts de análisis disponibles.
  • No pueden auditarse el parsing, los reintentos, las respuestas inválidas, los fallos ni la completitud de millones de respuestas.
  • No se fijan commit, revisión o hash exacto de GPT-OSS-20B ni de Qwen3.5-9B.
  • No se identifica motor de inferencia, cuantización, plantilla de chat, precisión numérica, paralelización ni versión de dependencias.
  • Para Gemini 3 Pro, GPT-5.2 y Claude Sonnet 4.5 no se informan endpoint, snapshot, fecha, parámetros ni proveedor efectivo.
  • Se informan temperatura y top_p, pero no semillas ni política de determinismo.
  • El corpus es el producto cartesiano equiprobable de variables diseñadas y no refleja prevalencias ni covariación humana.
  • El producto cartesiano contiene combinaciones raras o sociológicamente inverosímiles, reconocido por los autores.
  • Las diez variables son una reducción normativa de la cultura y no abarcan lenguaje, historia, instituciones, clase, región o contexto situacional.
  • La variable aceptabilidad moral agrupa cuestiones heterogéneas como aborto, eutanasia, divorcio, suicidio y homosexualidad.
  • Las categorías se tratan como ordinales para correlaciones pese a que los autores las describen como conceptualmente categóricas.
  • El sentido de la codificación ordinal se elige para concordar con indicadores IW, lo que introduce decisiones analíticas orientadas al patrón esperado.
  • La generación está completamente en inglés y no prueba equivalencia multilingüe ni formulaciones culturalmente localizadas.
  • Una sola familia principal de modelo genera perfiles, metadatos y respuestas, aumentando dependencia y coherencia autocausada.
  • El prompt obliga a explicitar cada variable y prohíbe contradicciones; preguntar después por esos mismos constructos crea fuga de constructo.
  • RQ1 reutiliza indicadores ligados a las variables que ya definieron la persona, por lo que no es una validación independiente.
  • La sustitución post hoc de Voronoi por una cuadrícula ocurre tras observar que no hay clústeres.
  • El tamaño de celda, soporte 0,2 y umbral de retención no se someten a análisis de sensibilidad publicado.
  • No hay baseline con configuración directa, perfil barajado, persona vacía, demografía sola o persona genérica.
  • RQ2 carece de comparación con el modelo sin persona; el EMD observado no puede atribuirse al perfil generado.
  • El modelo genera simultáneamente el triple demográfico y las respuestas, de modo que agrupación y conducta comparten los mismos priors.
  • La asociación entre configuración cultural y país es endógena al modelo y puede reproducir estereotipos de preentrenamiento.
  • La distribución demográfica sintética está muy sesgada a Europa/Norteamérica, urbano, educación terciaria y edades 30–49.
  • El 65,3 % de RQ2 se concentra en tres grupos urbano-terciarios; los resultados agregados están dominados por esos grupos.
  • Trece grupos tienen menos de 100 perfiles y uno tiene n=1, sin intervalos ni reglas de tamaño mínimo.
  • La ponderación usa tamaños de grupos inventados por el LLM, no pesos poblacionales humanos.
  • Los tamaños y la incertidumbre de las distribuciones humanas de referencia no se reportan ni se propagan.
  • Los umbrales EMD 0,4 y 0,2 se denominan moderado/alto sin una justificación empírica publicada.
  • La fórmula impresa de EMD no explicita normalización entre preguntas con escalas distintas; sin código no puede verificarse la comparabilidad.
  • El score 1−EMD se promedia entre preguntas y grupos sin intervalos de confianza ni prueba frente a un baseline.
  • No hay respuestas MFQ-2 humanas para validar los perfiles morales.
  • Las dos representaciones morales son generadas por LLM; su similitud mide acuerdo entre construcciones sintéticas.
  • El oráculo Gemini se selecciona post hoc por mayor varianza, criterio que puede favorecer patrones visualmente informativos sin mayor validez.
  • No se publican resultados comparables completos de los otros oráculos ni una regla de selección previa.
  • El texto llama ground truth a una r_MFT durante la selección, aunque el objetivo lógico parece ser aproximar r_MFQ; la especificación es internamente ambigua.
  • El split train/validation, el criterio de parada, la corrección lineal, las semillas y la distribución de R² no están detallados.
  • Splits aleatorios sobre un producto cartesiano reutilizan los mismos 32 niveles categóricos en entrenamiento y validación y no prueban generalización a culturas o configuraciones nuevas.
  • La repetición de 50 splits evalúa estabilidad de selección, no validez externa del fundamento moral.
  • La revisión de ISMed no informa número de perfiles, expertos, formación, rúbrica, cegamiento, desacuerdos ni fiabilidad entre evaluadores.
  • La validación Qwen usa solo 300 de 93.312 configuraciones y no detalla completamente el muestreo uniforme en espacio IW.
  • Las distancias Qwen–GPT carecen de baseline, escala de referencia, intervalos y umbral previamente justificado.
  • La comparación moral entre Qwen y GPT es principalmente visual y no informa correlaciones, EMD u otra métrica de concordancia.
  • No se separan variación por regenerar la persona, por volver a responder el cuestionario y por muestreo estocástico.
  • No se evalúan modelos cerrados o abiertos adicionales de forma completa sobre todo el corpus.
  • Las conclusiones son descriptivas y no permiten predicción individual, causalidad ni decisiones sobre personas o grupos.
  • Las personas con nombres, países y profesiones plausibles pueden reforzar estereotipos aunque no correspondan a individuos reales.
  • WVS-7 corresponde a 2017–2022 y puede no reflejar cambios culturales recientes, reconocido por los autores.

Qué no demuestra

  • No demuestra que un LLM posea cultura, valores morales o una identidad social humana.
  • No establece que las personas sintéticas sean individuos culturalmente auténticos o realistas.
  • No prueba que una configuración equiprobable corresponda a la distribución de una población real.
  • No valida predicciones individuales de respuestas WVS o MFQ-2.
  • No establece equivalencia estadística entre distribuciones sintéticas y humanas.
  • No demuestra que el perfil generado aporte más que indicar directamente las diez variables al modelo.
  • No separa aprendizaje cultural del modelo de obediencia al prompt o repetición semántica.
  • No demuestra que el país, edad, género u ocupación generados sean consecuencias sociológicas válidas de los valores.
  • No aporta un criterio humano externo para afirmar que el mapeo de fundamentos morales sea correcto.
  • No establece que mayor varianza de un oráculo implique mayor calidad o validez moral.
  • No demuestra robustez multilingüe, intercultural o entre formulaciones de prompt.
  • No justifica usar las personas para decisiones clínicas, políticas, educativas, comerciales o sobre colectivos.
  • No prueba causalidad entre variables culturales y fundamentos morales.
  • No permite reproducir de extremo a extremo los resultados mientras código, datos y revisiones de modelos permanezcan sin publicar.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2601.22396v2, revised 3 June 2026; 25-page preprint marked Under Review

Fuente consultada: https://arxiv.org/pdf/2601.22396v2

Revisión: Codex full-text, bilingual-fidelity, arXiv-version, 25-page visual, construct-leakage, distributional-weighting, EMD-scale, moral-oracle, model-version, artifact-availability and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI GPT-OSS-20B as the default open-weight persona-generation and response model; exact repository revision and serving stack not reported
  • Qwen3.5-9B as a cross-model check on 300 configurations with three runs per configuration; exact revision not reported
  • Google Gemini 3 Pro selected as the culture-to-morality oracle because its outputs had greater variance
  • OpenAI GPT-5.2 evaluated as an alternative culture-to-morality oracle; detailed outputs and API snapshot not reported
  • Anthropic Claude Sonnet 4.5 evaluated as an alternative culture-to-morality oracle; detailed outputs and API snapshot not reported

Instrumentos y métricas

  • Ten author-defined categorical cultural variables derived from WVS-7 items and Inglehart–Welzel dimensions
  • Persona generation prompt with explicit metadata, bio, and ten-variable cultural mapping
  • Ten IVS/WVS indicators used to reconstruct Inglehart–Welzel coordinates
  • WorldValuesBench WVB-Probe: 36 value questions and continent × settlement × education reference groups
  • Moral Foundations Questionnaire-2: 36 items across Care, Equality, Proportionality, Loyalty, Authority, and Purity
  • LLM-judged 32 cultural-value × 6 moral-foundation mapping matrix
  • Earth Mover's Distance and reported 1−EMD aggregate alignment
  • Regular-grid partition and FPClose closed frequent-itemset mining
  • Greedy forward variable selection, linear correction, validation R², and 50 repeated splits
  • Spearman correlations and qualitative cross-model IW/moral map comparison

Datos utilizados

  • World Values Survey Wave 7 country-pooled datafile, version 5.0, covering survey waves from 2017–2022
  • Integrated Values Surveys: merged EVS Trend File and WVS Trend File for Inglehart–Welzel reconstruction
  • WorldValuesBench WVB-Probe split with 36 questions and human reference distributions for demographic triples
  • 93,312 GPT-OSS-20B-generated persona profiles, one per designed cultural configuration; not publicly released at review time
  • 92,710 generated personas mapped to 45 WVB-Probe-supported demographic groups for RQ2
  • 300-condition Qwen3.5-9B validation sample drawn uniformly from generated Inglehart–Welzel space

Evidencia y localización

  • Estado editorial, versiones, autores y resumen: arXiv:2601.22396v2 abstract page and submission history; revised 3 June 2026; marked Under Review
  • Variables, 93.312 configuraciones, generación y revisión experta: arXiv v2, Section 3 and Appendices C–E, Tables 5–10 and Figure 5
  • Proyección IW, cuadrícula, itemsets y resultados RQ1: arXiv v2, Sections 4.1 and 5.1, Figures 2–3 and 9–11, Table 1
  • WVB-Probe, EMD, cobertura y desigualdad demográfica: arXiv v2, Sections 4.2 and 5.2, Tables 2–3 and 11, Figures 7 and 12
  • MFQ-2, selección del oráculo y mapeo moral: arXiv v2, Sections 4.3 and 5.3, Figures 8 and 13–16, Tables 12–13
  • Validación Qwen sobre 300 configuraciones: arXiv v2, Appendix J, Figures 17–18
  • Entorno, parámetros y reproducibilidad declarada: arXiv v2, Appendix A and Reproducibility Statement
  • Limitaciones, riesgos de estereotipo y alcance descriptivo: arXiv v2, Limitations and Ethical Considerations
  • Ausencia de publicación definitiva y enlaces oficiales de código/datos: arXiv abstract Code, Data and Media section and targeted title/arXiv/GitHub searches, checked 15 July 2026