The Personality Trap: How LLMs Embed Bias When Generating Human-Like Personas

Aplicaciones, sesgos y seguridad2026arXivRevisión editorial aprobada

Autores: Jacopo Amidei, Gregorio Ferreira, Mario Muñoz Serrano, Rubén Nieto, Andreas Kaltenbrunner

Palabras clave: Large Language Models, Personality, Bias, Persona, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
10
Hallazgos
38
Limitaciones
15
Evidencias

Resumen editorial

Español

El estudio analiza qué demografía inventan cinco LLM cuando reciben únicamente preguntas y respuestas EPQR-A y se les pide escribir una biografía con edad, género, orientación sexual, raza, religión, ocupación, política y ubicación. Los modelos generadores son GPT-3.5, GPT-4o, Claude 3.5 Sonnet, Llama 3.2-3B y Llama 3.1-70B. El punto de partida no es una muestra humana: son 826 respuestas EPQR-A previamente simuladas por gpt-4o-2024-05-13 a temperatura 1, a su vez basadas en sexo y edad de 826 universitarios españoles, 655 mujeres y 171 hombres, con medias de edad próximas a 19 años. De esa procedencia solo se pasan al nuevo modelo los ítems contestados, no las etiquetas demográficas.

Para cada modelo se generan diez poblaciones Base y cinco poblaciones MaxN y MaxP. MaxN cambia respuestas hasta llevar Neuroticismo al máximo; MaxP hace lo mismo con Psychoticism. Son 20 poblaciones × 826 perfiles × 5 modelos, es decir, 82.600 relatos-persona antes de las evaluaciones posteriores. Una sola población “representativa” por condición y modelo, elegida porque la variación entre trials se considera pequeña pero sin regla de selección publicada, vuelve a contestar EPQR-A; las Base responden también BFI-44. El trabajo compara scores, accuracy, MAE/RMSE, correlaciones EPQR-A–BFI y alfa de Cronbach.

Las distribuciones Base muestran estereotipos fuertes, pero distintos por modelo. GPT-3.5 genera 90,82 % mujeres; Claude, 87,84 %; Llama 3.2-3B, 100 % hombres; Llama 3.1-70B, 77,94 % hombres; GPT-4o reparte 25,71 % mujeres, 44,75 % hombres y 29,18 % no binario. GPT-4o produce 29,93 % LGBTQ+, mientras GPT-3.5 y Llama 3.2-3B quedan aproximadamente en cero y Claude en 3,22 %. En raza, GPT-4o es 98,98 % blanco, GPT-3.5 88,59 %, Llama 3.2-3B 100 %, Llama 3.1-70B 99,08 % y Claude 62,03 % blanco/34,82 % asiático. Las edades se concentran entre 28 y 32, no alrededor de los 19 años de la muestra fuente; las ubicaciones son grandes ciudades estadounidenses salvo Londres y los empleos suelen requerir alta educación.

La etiqueta general “WEIRD” describe bien el sesgo occidental, urbano, educado y racialmente estrecho de buena parte de las salidas, pero no existe una población objetivo completa contra la que estimar representatividad. Solo se conocen sexo y edad de la muestra humana original, y los 826 perfiles de entrada son respuestas sintéticas, no observaciones de esa población. Para raza, religión, política, ubicación u orientación sexual no hay distribución real de referencia. Por ello los porcentajes prueban defaults y asociaciones generativas del modelo, no un error estadístico calculado frente a una población representativa. El paper reconoce en Limitations que falta repetir con cuestionarios humanos y comparar con otros métodos de generación.

El resultado de seguridad más importante aparece en MaxP y es muy grande en dos modelos. GPT-4o pasa de 29,18 % a 88,76 % de identidades no binarias y de 29,93 % a 94,12 % LGBTQ+; Claude pasa de 3,22 % a 96,66 % no binario y de 3,22 % a 99,08 % LGBTQ+. También suben fuertemente las etiquetas progresistas. No es un patrón universal: GPT-3.5 queda en 0,31 % para ambas categorías, Llama 3.2-3B en 0 % y Llama 3.1-70B en 0,38 % no binario/3,00 % LGBTQ+. El propio artículo afirma correctamente que esto no implica ninguna asociación real y lo presenta como posible estereotipo o inferencia patologizante.

El mecanismo no permite atribuir el cambio a un rasgo psicológico latente. El prompt entrega las 24 preguntas y sus respuestas, y pide inferir una biografía. Maximizar P cambia seis respuestas cuyo contenido habla directamente de reglas, drogas, matrimonio, engaño, aprovechamiento y conducta convencional; los ejemplos muestran que la biografía parafrasea esos ítems. Así, el contraste MaxP activa simultáneamente la etiqueta psicométrica y señales semánticas explícitas que el modelo asocia con identidades y política. El hallazgo demuestra una asociación peligrosa del generador bajo ese patrón textual, pero no que “Psychoticism” humano cause o prediga género u orientación. Además, la escala P de EPQR-A no equivale a psicosis clínica y tiene baja fiabilidad en varios resultados.

La tabla principal y la prosa no usan siempre el mismo snapshot de resultados. El texto atribuye a GPT-4o 29,27±1,70 % no binario, mientras la Tabla 1 dice 29,18±1,76; da 29,96±1,52 % LGBTQ+ frente a 29,93±1,63; para Claude cita 35,16±1,72 % asiático frente a 34,82±1,43. Más materialmente, afirma porciones conservadoras de 42,68 % y 33,16 % para Llama 3.2-3B y Llama 3.1-70B, pero la Tabla 2 informa 32,56 % y 42,93 %. Estas divergencias impiden saber qué corrida sostiene exactamente el relato.

Los tests de diferencias demográficas se aplican a diez promedios Base y cinco MaxN/MaxP mediante t-tests bilaterales. Las proporciones son composicionales, las mismas 826 entradas se reutilizan en todas las condiciones y se prueban numerosas categorías, modelos y contrastes; no se documenta corrección por multiplicidad, tratamiento de dependencia, seeds, temperatura de los cinco generadores o diagnóstico de supuestos. La baja desviación entre trials puede significar consistencia del default estereotípico, no representatividad. Las agregaciones también cambian la interpretación: “non-binary” incluye gender-fluid y non-conforming; “LGBTQ+” agrupa gay, lesbiana, bisexual, pansexual, queer, asexual y demisexual; “Centre” incluye independent/moderate; “Progressive” usa un conjunto amplio; y religiones distintas se colapsan en “Other”.

La aparente fidelidad de personalidad es en gran medida un circuito cerrado. El relato se genera desde los mismos 24 ítems y después el mismo modelo vuelve a contestarlos interpretando el relato. El paper muestra explícitamente copias semánticas: “rarely stays in the background” replica el ítem 15 y “always practicing what they preach” el ítem 24. GPT-4o alcanza accuracy Base de 97,68 % en E, 93,04 % en N, 98,20 % en P y 99,23 % en L. Es evidencia de preservación textual del prompt, no de un constructo psicológico profundo.

La BFI aporta cierta generalización de vocabulario: las correlaciones EPQR-A/BFI en E son 0,94–0,99 y en N 0,70–0,93. Sin embargo, el mismo modelo genera relato y respuestas, las dimensiones se verbalizan de forma explícita y existen correlaciones cruzadas muy altas, por ejemplo EPQR-P con BFI-O de 0,50–0,71 y EPQR-E con BFI-A de hasta 0,86, que no se contrastan formalmente con coeficientes humanos. La procedencia de la fila BFI “Input” tampoco se explica, pese a que el método define la entrada como respuestas EPQR-A. Las alfas altas pueden reflejar determinismo y redundancia; P es baja, entre 0,18 y 0,68 en MaxP, L de Llama 3.2-3B cae a 0,01–0,27 y el N de Claude MaxN es indefinido por ausencia de varianza. El control aleatorio destruye deliberadamente la covarianza entre ítems al muestrearlos por marginales, de modo que su alfa cercana a cero no es un baseline neutral fuerte para “personalidad coherente”.

La reproducibilidad pública no está disponible en la fecha de auditoría. El paper enlaza anonymous.4open.science/r/the_personality_trap-F487/README.md, pero el servidor devuelve HTTP 410; no se localizó un repositorio público equivalente. Quedan especificados algunos nombres de modelo y costes, pero faltan código, datos generados, seeds, parámetros de decoding, logs, regla de muestra “representativa”, tests exactos, corrección de multiplicidad y versiones ejecutables completas de Claude/Llama. La superficie oficial solo confirma arXiv v1, 26 páginas, sin venue o peer review confirmado.

El trabajo identifica de forma convincente un riesgo de representación: ciertos modelos conectan un patrón de respuestas MaxP con identidades marginalizadas de manera extrema. Es una alarma útil para diseño y auditoría de generadores de personas. No valida poblaciones sintéticas como sustitutas de humanos, no demuestra correlaciones psicológicas reales y no permite afirmar que los modelos “reproducen” demografía humana sin una referencia apropiada.

English

The study examines which demographics five LLMs invent when given only EPQR-A questions and answers and asked to write a biography with age, gender, sexual orientation, race, religion, occupation, politics, and location. The generators are GPT-3.5, GPT-4o, Claude 3.5 Sonnet, Llama 3.2-3B, and Llama 3.1-70B. The starting point is not a human sample: it consists of 826 EPQR-A response sets previously simulated by gpt-4o-2024-05-13 at temperature 1, themselves based on the sex and age of 826 Spanish university students, 655 women and 171 men, with mean ages near 19. Only answered items, not demographic labels, are passed to the new model.

For each model the authors generate ten Base populations and five MaxN and MaxP populations. MaxN changes answers to maximize Neuroticism; MaxP does the same for Psychoticism. This is 20 populations × 826 profiles × 5 models, or 82,600 persona narratives before later assessments. A single “representative” population per condition and model, selected because trial variation was considered small, but without a published selection rule, retakes EPQR-A; Base populations also answer BFI-44. The study compares scores, accuracy, MAE/RMSE, EPQR-A–BFI correlations, and Cronbach's alpha.

Base distributions show strong but model-specific stereotypes. GPT-3.5 generates 90.82% women; Claude 87.84%; Llama 3.2-3B 100% men; Llama 3.1-70B 77.94% men; GPT-4o produces 25.71% women, 44.75% men, and 29.18% non-binary personas. GPT-4o produces 29.93% LGBTQ+ personas, whereas GPT-3.5 and Llama 3.2-3B are approximately zero and Claude is 3.22%. Racially, GPT-4o is 98.98% White, GPT-3.5 88.59%, Llama 3.2-3B 100%, Llama 3.1-70B 99.08%, and Claude 62.03% White/34.82% Asian. Ages cluster at 28–32 rather than near the source sample's age of 19; locations are major US cities except London and occupations tend to require higher education.

The broad “WEIRD” label reasonably describes the Western, urban, educated, and racially narrow defaults in much of the output, but there is no complete target population against which representativeness is estimated. Only sex and age are known for the source human sample, and the 826 input profiles are synthetic responses rather than observations from that population. There are no real reference distributions for race, religion, politics, location, or sexual orientation. The percentages therefore demonstrate model defaults and generative associations, not statistical bias calculated against a representative target. The paper acknowledges in Limitations that human-derived questionnaires and comparisons with other generation methods are needed.

The most important safety result occurs under MaxP and is very large for two models. GPT-4o moves from 29.18% to 88.76% non-binary and from 29.93% to 94.12% LGBTQ+; Claude moves from 3.22% to 96.66% non-binary and from 3.22% to 99.08% LGBTQ+. Progressive labels also rise sharply. The pattern is not universal: GPT-3.5 remains at 0.31% for both categories, Llama 3.2-3B at 0%, and Llama 3.1-70B at 0.38% non-binary/3.00% LGBTQ+. The paper correctly states that this does not imply any real-world association and frames it as possible stereotyping or pathologizing inference.

The mechanism does not isolate a latent psychological trait. The prompt supplies all 24 questions and answers and asks the model to infer a biography. Maximizing P changes six answers whose content directly concerns rules, drugs, marriage, cheating, exploitation, and conventional conduct; examples show the biography paraphrasing those items. The MaxP contrast therefore activates both a psychometric label and explicit semantic cues that the model associates with identity and politics. The finding demonstrates a dangerous generator association under that textual pattern, but not that human “Psychoticism” causes or predicts gender or orientation. EPQR-A P is also not clinical psychosis and has low reliability in several reported results.

The main tables and prose do not always use the same result snapshot. The prose assigns GPT-4o 29.27±1.70% non-binary versus 29.18±1.76 in Table 1, and 29.96±1.52% LGBTQ+ versus 29.93±1.63. It gives Claude 35.16±1.72% Asian versus 34.82±1.43. More materially, it reports conservative shares of 42.68% and 33.16% for Llama 3.2-3B and Llama 3.1-70B, while Table 2 gives 32.56% and 42.93%. These divergences make the exact run supporting the narrative unclear.

Demographic difference tests compare ten Base means and five MaxN/MaxP means through two-sided t-tests. Proportions are compositional, the same 826 inputs are reused across conditions, and many categories, models, and contrasts are tested; there is no documented multiplicity correction, dependence treatment, seed, generator temperature, or assumption diagnostic. Low between-trial standard deviation can indicate a consistent stereotyped default rather than representativeness. Aggregation also changes interpretation: “non-binary” includes gender-fluid and non-conforming; “LGBTQ+” combines gay, lesbian, bisexual, pansexual, queer, asexual, and demisexual; “Centre” includes independent/moderate; “Progressive” uses a broad synonym set; and distinct religions are collapsed into “Other.”

Apparent personality fidelity is largely a closed loop. A narrative is generated from the same 24 items, then the same model answers those items again while role-playing the narrative. The paper explicitly shows semantic copies: “rarely stays in the background” mirrors item 15 and “always practicing what they preach” mirrors item 24. GPT-4o reaches Base accuracy of 97.68% for E, 93.04% for N, 98.20% for P, and 99.23% for L. This is evidence of textual preservation from the prompt, not a deep psychological construct.

BFI provides some vocabulary-level generalization: EPQR-A/BFI correlations are 0.94–0.99 for E and 0.70–0.93 for N. Yet the same model creates both narrative and answers, dimensions are explicitly verbalized, and large cross-loadings appear, EPQR-P with BFI-O is 0.50–0.71 and EPQR-E with BFI-A reaches 0.86, without formal comparison to human coefficients. The origin of the BFI “Input” row is also unexplained even though the stated input is EPQR-A responses. High alpha can reflect determinism and redundancy; P falls to 0.18–0.68 under MaxP, L for Llama 3.2-3B to 0.01–0.27, and Claude MaxN N is undefined because there is no variance. The random control deliberately destroys inter-item covariance by sampling item marginals independently, so its near-zero alpha is not a strong neutral baseline for “coherent personality.”

The public reproducibility artifact is unavailable at audit time. The paper links anonymous.4open.science/r/the_personality_trap-F487/README.md, but the server returns HTTP 410 and no equivalent public repository was found. Some model names and costs remain documented, but code, generated data, seeds, decoding parameters, logs, the “representative” sample rule, exact tests, multiplicity handling, and executable Claude/Llama versions are missing. The official record confirms only a 26-page arXiv v1 preprint, not a venue or peer review.

The work convincingly identifies a representational risk: some models connect a MaxP answer pattern to marginalized identities at extreme rates. This is a useful warning for persona-generator design and auditing. It does not validate synthetic populations as human substitutes, demonstrate real psychological correlations, or show that models “reproduce” human demography without an appropriate reference.

Pregunta de investigación

¿Qué atributos sociodemográficos inventan cinco LLM al transformar respuestas EPQR-A en personas, cómo cambian al maximizar Neuroticismo o Psychoticism y hasta qué punto el relato conserva las respuestas de personalidad?

Método

Se reutilizan 826 EPQR-A ya contestados sintéticamente por GPT-4o. Cinco modelos generan diez poblaciones Base y cinco MaxN/MaxP de 826 personas. Se agregan ocho atributos sociodemográficos, se comparan proporciones con t-tests y una población por condición vuelve a contestar EPQR-A; las Base contestan BFI. Se calculan accuracy, MAE/RMSE, correlaciones y alfa de Cronbach. La auditoría contrasta todas las tablas, prompts y apéndices y verifica el estado del artefacto enlazado.

Muestra: Cinco generadores × 826 perfiles × 20 poblaciones por modelo (10 Base, 5 MaxN y 5 MaxP) producen 82.600 relatos. La evaluación psicométrica retiene una población por condición y modelo, pero no publica la regla para elegirla. Los t-tests demográficos operan sobre 10 trials Base frente a 5 trials manipulados; no se informan seeds, pérdidas, parse failures ni el total de llamadas/tokens.

Hallazgos

  • Las poblaciones Base exhiben defaults distintos y extremos por modelo en género, raza, religión, política, edad, ocupación y ubicación.
  • Cuatro modelos generan 88,59–100 % de personas blancas; Claude genera 62,03 % blancas y 34,82 % asiáticas.
  • MaxP eleva no binario/LGBTQ+ a 88,76/94,12 % en GPT-4o y 96,66/99,08 % en Claude.
  • El aumento MaxP no se generaliza: GPT-3.5, Llama 3.2-3B y Llama 3.1-70B permanecen cerca de cero en esas categorías.
  • La asociación observada es una señal de estereotipo del generador y el paper niega explícitamente que implique relación real.
  • Las biografías preservan frases de los ítems EPQR-A y permiten accuracies de re-administración muy altas, especialmente en GPT-4o y Claude.
  • EPQR-E/BFI-E correlaciona 0,94–0,99 y EPQR-N/BFI-N 0,70–0,93, junto con cross-loadings sustanciales.
  • La escala P presenta fiabilidad baja, sobre todo en MaxP, y varias escalas extremas pierden varianza.
  • Prosa y tablas contienen varias cifras incompatibles, incluyendo las proporciones conservadoras de ambos Llama.
  • El artefacto oficial de código citado por el paper ya no es accesible.

Limitaciones

  • La entrada es una población sintética generada por GPT-4o, no respuestas humanas.
  • El marco humano de origen solo aporta sexo y edad y ya es una muestra universitaria estrecha.
  • No hay población objetivo para medir representatividad de raza, religión, política, ubicación u orientación sexual.
  • Los porcentajes describen defaults del generador, no bias estadístico contra una distribución real definida.
  • El prompt recibe preguntas y respuestas completas, que contienen señales semánticas directas para la biografía.
  • MaxP cambia simultáneamente el score y el contenido explícito sobre reglas, drogas, matrimonio y conducta.
  • No se aísla la etiqueta Psychoticism del wording de sus seis ítems.
  • EPQR-A P no equivale a psicosis clínica; la terminología puede favorecer una lectura patologizante incorrecta.
  • El efecto no es uniforme entre modelos y se concentra de forma extrema en GPT-4o y Claude.
  • Las agregaciones de género y orientación combinan identidades distintas y afectan las tasas publicadas.
  • Las categorías política, raza y religión son estrechas y culturalmente situadas.
  • Islam, hinduismo y budismo se colapsan en Other; las afirmaciones de ausencia no son auditables desde las tablas agregadas.
  • No se muestran tablas de edad, ubicación u ocupación pese a usarlas para las conclusiones WEIRD.
  • La prosa y las tablas no concuerdan en varias medias y desviaciones.
  • La discrepancia de porcentajes conservadores de Llama cambia qué modelo parece más conservador.
  • Se comparan 10 trials Base con 5 trials manipulados sin justificar el balance.
  • Las proporciones suman 100 % por categoría, pero se tratan con t-tests separados.
  • Las mismas 826 entradas se reutilizan; el tratamiento de la dependencia no se documenta.
  • No hay corrección por las numerosas comparaciones de categorías, condiciones y modelos.
  • No se informan tests de supuestos, intervalos de efecto o un modelo jerárquico por entrada y trial.
  • Faltan temperaturas, seeds y parámetros de decoding de los cinco generadores evaluados.
  • Los identificadores publicados de GPT y Claude no son todos snapshots ejecutables inequívocos.
  • Una sola población “representativa” se elige para RQ3 sin criterio reproducible.
  • La incertidumbre entre trials no se propaga a accuracy, correlaciones o alpha.
  • El mismo modelo genera el relato y contesta los cuestionarios desde ese relato.
  • EPQR-A se re-administra después de haber expuesto literalmente sus ítems y respuestas.
  • La alta accuracy puede medir copia o paraphrase memory, no personalidad subyacente.
  • BFI comparte vocabulario de rasgos y no rompe por completo el circuito de autoconsistencia.
  • Las correlaciones se comparan narrativamente, no mediante equivalencia con coeficientes humanos.
  • La fila BFI Input no tiene procedencia metodológica clara.
  • Alpha alto no establece validez; puede resultar de respuestas deterministas o redundantes.
  • La escala P muestra alpha 0,18–0,68 en MaxP y el N de Claude MaxN es indefinido.
  • El baseline aleatorio conserva marginales pero destruye por diseño la covarianza entre ítems.
  • No se evalúa conducta, decisión, interacción, validez predictiva o juicio humano de autenticidad.
  • No se estudian idiomas, culturas, prompts alternativos o robustez de las categorías.
  • El enlace oficial de código devuelve HTTP 410 y no se encontró espejo público.
  • Sin código y datos no se pueden reconstruir normalización, tests, parseos ni selección de muestra.
  • El estudio es arXiv v1 y no acredita venue ni revisión por pares.

Qué no demuestra

  • No establece que las poblaciones generadas sean representativas de una población humana definida.
  • No demuestra que personalidad y demografía mantengan las mismas correlaciones que en humanos.
  • No implica relación real entre Psychoticism, identidad no binaria u orientación LGBTQ+.
  • No demuestra causalidad de un rasgo latente porque cambia directamente el contenido textual de los ítems.
  • No valida EPQR-A o BFI como mediciones psicológicas equivalentes en LLM.
  • No prueba que alta autoconsistencia del relato corresponda a una personalidad profunda o estable.
  • No justifica usar personas sintéticas como sustitutas de participantes, encuestas o user research.
  • No permite reproducción fiel con el artefacto público disponible en la fecha de auditoría.
  • No confirma generalización fuera de inglés, cinco modelos y un único prompt.
  • No confirma publicación revisada por pares.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2602.03334v1, submitted 3 February 2026; preprint, 26 pages

Fuente consultada: https://arxiv.org/pdf/2602.03334v1

Revisión: Codex full-text, bilingual-fidelity, 26-page visual, arXiv-v1, synthetic-input, demographic-baseline, MaxN-MaxP, protected-identity, psychometric-circularity, table-prose-consistency, compositional-statistics, aggregation, construct-validity and artifact-availability audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • gpt-4o-2024-05-13 at temperature 1, generator of the 826 input questionnaires
  • GPT-3.5, reported as gpt3.5-turbo-0125
  • GPT-4o, reported as gpt4o-2024-11-20
  • Claude 3.5 Sonnet, exact snapshot incompletely specified
  • Llama 3.2-3B on Amazon AWS, exact checkpoint and serving configuration unspecified
  • Llama 3.1-70B on Amazon AWS, exact checkpoint and serving configuration unspecified

Instrumentos y métricas

  • Eysenck Personality Questionnaire Revised-Abbreviated (EPQR-A), 24 yes/no items
  • EPQR-A Extraversion, Neuroticism, Psychoticism and Lie scales, six items each
  • Big Five Inventory (BFI), 44 Likert items
  • MaxN and MaxP item-answer interventions
  • Structured JSON persona and eight sociodemographic attributes
  • Post-hoc canonical demographic category aggregation
  • Two-sided t-tests
  • Accuracy, precision, recall, specificity, MAE and RMSE
  • Pearson cross-instrument correlations
  • Cronbach's alpha

Datos utilizados

  • 826 synthetic English EPQR-A response sets from Ferreira et al. (2025)
  • Source demographic frame: 655 women and 171 men from a Spanish university sample, mean age about 19
  • Ten Base and five MaxN/MaxP populations per generator
  • 82,600 generated persona narratives by arithmetic reconstruction
  • One selected population per model and condition for questionnaire re-administration
  • Anonymous 4open.science artifact F487, unavailable with HTTP 410 at audit time

Evidencia y localización

  • Metadatos, autores, abstract, versión y estado: Official arXiv:2602.03334v1 surface, submitted 3 February 2026
  • Procedencia de 826 inputs, modelos y costes: Paper, pp. 4–5, Section 3.1 and footnotes 1–3
  • Trials, selección de una población y métricas: Paper, pp. 5–6, Sections 3.2–3.3
  • Distribuciones Base y MaxN/MaxP: Paper, pp. 6–8, Tables 1–3
  • Divergencias entre prosa y tablas: Paper, pp. 6–8, narrative after Tables 1–3 compared with table cells
  • Scores EPQR-A y tests de diferencia: Paper, p. 9, Table 4
  • Accuracy, MAE y RMSE: Paper, pp. 25–26, Appendix D, Tables A4–A5
  • Correlaciones EPQR-A–BFI: Paper, p. 10, Tables 5–6
  • Fiabilidad y baseline aleatorio: Paper, p. 11, Tables 7–8
  • Interpretación, cautela y limitaciones reconocidas: Paper, pp. 11–14, Sections 5–7
  • Copia semántica y ejemplos MaxP: Paper, pp. 9 and 18–20, Section 4.2 and Appendix A
  • Prompts de generación y re-administración: Paper, pp. 21–23, Appendix B
  • Reglas de agregación demográfica: Paper, pp. 23–24, Appendix C
  • Inspección visual integral: Paper, all 26 rendered pages, including every table, figure, prompt and appendix page
  • Artefacto no reproducible: Paper-linked anonymous.4open.science artifact F487 returned HTTP 410 on 15 July 2026; public repository search found no equivalent