Human Psychometric Questionnaires Mischaracterize LLM Behavior

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Título original: Established Psychometric vs. Ecologically Valid Questionnaires: Rethinking Psychological Assessments in Large Language Models

Autores: Woojung Song, Dongmin Choi, Yoonah Park, Jongwook Han, Eun-Ju Lee, Yohan Jo

Palabras clave: Large Language Models, Personality, Psychometrics, Persona, Personality Control

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
15
Hallazgos
38
Limitaciones
10
Evidencias

Resumen editorial

Español

Este preprint compara dos formas de perfilar ocho LLM abiertos en diez valores de Schwartz y los cinco rasgos Big Five. La primera administra PVQ-40, PVQ-21, BFI-44 y BFI-10 como autoinformes Likert, con dos órdenes de opciones contrabalanceados. La segunda calcula la suma de log-probabilidades de respuestas candidatas fijas del dataset Value Portrait: 520 pares procedentes de 104 consultas reales de ShareGPT, LMSYS, Reddit y Dear Abby, validados previamente con 681 participantes; 286 pares se etiquetan con valores y 228 con rasgos cuando la correlación humana alcanza r ≥ 0,3. Los modelos son Gemma 3 4B/27B, Qwen 2.5 7B/72B, Qwen 3 30B-A3B/235B-A22B y GPT-OSS 20B/120B. El trabajo encuentra alta concordancia de rango entre versiones largas y cortas del mismo tipo de cuestionario, Spearman medio 0,74 para PVQ y 0,77 para BFI, pero concordancia menor con el perfil de generación: 0,31/0,28 para valores y 0,26/0,11 para rasgos. Los cuestionarios también muestran mucha más estructura entre ítems que Value Portrait. En una prueba de reconocimiento de constructos, siete modelos obtienen F1 media 0,69–0,83 en instrumentos establecidos y 0,09 en VP; cinco encoders asignan el constructo correcto a 77–81% de los ítems establecidos, frente a 11–26% de VP. Esta es la evidencia más sólida: la redacción de los cuestionarios revela de forma muy explícita qué dimensión se mide y permite respuestas coherentes con el constructo sin demostrar una disposición estable. En ocho personas demográficas, género, edad, ideología y educación, los desplazamientos medios del PVQ se parecen a diferencias marginales de ESS: coseno medio 0,60 para PVQ-40 y 0,47 para PVQ-21, con 62/80 y 55/80 signos coincidentes. VP obtiene coseno medio −0,03, coseno agregado 0,007 con IC bootstrap del 95% [−0,221, 0,236] y 40/80 signos, indistinguible de 50%. Los desplazamientos normalizados del cuestionario son 0,67/0,71 frente a 0,20 en humanos y 0,37 en VP; esta medida es una magnitud relativa dentro del perfil, no Cohen’s d. La interpretación debe ser más estrecha que el título. Value Portrait no observa generación libre: puntúa cinco respuestas preescritas por consulta, suma log-probabilidades sin normalizar por longitud y luego promedia por escenario y constructo. La validación de cobertura solo comprueba el candidato VP mejor situado entre diez muestras libres; su mediana global es rango 4, pero varía de 1 a 11 según modelo y no valida los cinco candidatos ni el promedio de cada constructo. Los perfiles comparados usan instrumentos, ítems, escalas y estimadores distintos. Además, con solo cinco rasgos Spearman es discreto; los ocho modelos pertenecen a cuatro familias relacionadas; NDCG rompe empates Likert con el orden arbitrario de argsort; y la fila agregada de RQ2 es la mediana de ocho p-valores, no una prueba conjunta. En RQ4, las 80 señales no son ensayos independientes: los pares de personas son opuestos, los perfiles se centran y los valores de Schwartz están correlacionados. Las diferencias marginales de ESS tampoco aíslan efectos causales de edad, educación, política o país. El propio paper reconoce que no existe un baseline humano emparejado para RQ1–RQ3 y que el método de probabilidad es una medición controlada entre cuestionario y generación abierta. Código y datos se prometen para cuando se publique; a 15 de julio de 2026 el trabajo figura como under review y no se localizaron artefactos del estudio. La conclusión defendible es que los cuestionarios humanos pueden medir con mucha fuerza la habilidad del modelo para reconocer el significado y la deseabilidad de sus ítems, y no bastan como prueba de rasgos estables o conducta futura. El estudio no demuestra todavía que VP sea una medida más exacta de comportamiento real ni que sus perfiles predigan generación libre.

English

This preprint compares two ways of profiling eight open-weight LLMs on ten Schwartz values and the five Big Five traits. The first administers PVQ-40, PVQ-21, BFI-44, and BFI-10 as Likert self-reports with two counterbalanced option orders. The second scores fixed candidate responses from the Value Portrait dataset by summed token log-probability: 520 query-response pairs from 104 real-world ShareGPT, LMSYS, Reddit, and Dear Abby queries, previously validated with 681 participants; 286 pairs are value-tagged and 228 trait-tagged when the human correlation reaches r ≥ 0.3. Models are Gemma 3 4B/27B, Qwen 2.5 7B/72B, Qwen 3 30B-A3B/235B-A22B, and GPT-OSS 20B/120B. Long and short versions of the same questionnaire type agree strongly in rank, mean Spearman 0.74 for PVQ and 0.77 for BFI, while agreement with generation-probability profiles is lower: 0.31/0.28 for values and 0.26/0.11 for traits. Established instruments also show much stronger item structure. In a construct-recognition task, seven models obtain mean F1 of 0.69–0.83 on established instruments and 0.09 on VP; five sentence encoders assign the correct construct to 77–81% of established items versus 11–26% of VP items. This is the strongest result: questionnaire wording makes the measured dimension highly transparent and can support construct-consistent answers without establishing a stable disposition. Across eight demographic personas, gender, age, political orientation, and education, model-averaged PVQ shifts resemble marginal ESS subgroup differences: mean cosine 0.60 for PVQ-40 and 0.47 for PVQ-21, with 62/80 and 55/80 matching signs. VP has mean cosine −0.03, aggregate cosine 0.007 with 95% bootstrap CI [−0.221, 0.236], and 40/80 matching signs, indistinguishable from 50%. Normalized shift magnitudes are 0.67/0.71 for the questionnaires, 0.20 for humans, and 0.37 for VP; this is a within-profile relative magnitude, not Cohen’s d. Interpretation must be narrower than the title. Value Portrait is not unconstrained generation: it scores five prewritten responses per query, sums token log-probabilities without length normalization, then averages by scenario and construct. The coverage check only ranks the highest VP candidate against ten free samples; its global median rank is four but model-specific medians range from one to eleven, and this does not validate all five candidates or every construct average. Compared profiles use different instruments, items, scales, and estimators. With only five traits Spearman is coarse; the eight models come from four related families; NDCG resolves Likert ties using NumPy argsort order; and the aggregate RQ2 row is the median of eight p-values rather than a combined test. In RQ4, 80 signs are not independent trials because persona pairs oppose each other, profiles are centered, and Schwartz values are correlated. Marginal ESS subgroup contrasts also do not isolate causal effects of age, education, politics, or country. The paper acknowledges that RQ1–RQ3 lack a matched human baseline and that its probability method is a controlled measurement between questionnaire response and open generation. Code and data are promised upon publication; as of 15 July 2026 the work is listed as under review and no study artifacts were located. The defensible conclusion is that human questionnaires can strongly measure a model’s ability to recognize item meaning and desirability and are insufficient evidence of stable traits or future behavior. The study does not yet establish that VP is a more accurate measure of real behavior or that its profiles predict unconstrained generation.

Pregunta de investigación

¿Hasta qué punto los perfiles de valores y rasgos obtenidos al pedir autoinformes Likert a LLM coinciden con perfiles construidos desde probabilidades de respuestas a consultas realistas, por qué los cuestionarios parecen internamente coherentes y si sus desplazamientos bajo personas demográficas se trasladan a esa conducta generativa controlada?

Método

Se administran PVQ-40/PVQ-21 y BFI-44/BFI-10, en dos órdenes de respuesta, a ocho modelos de cuatro familias. En paralelo se calcula para 104 escenarios Value Portrait la suma no normalizada por longitud de log-probabilidades de cinco respuestas candidatas fijas y se agregan los pares etiquetados con r ≥ 0,3 por escenario y constructo. Se comparan rankings con Spearman y NDCG, estructura de ítems con eta cuadrado y varianza intraconstructo, transparencia textual con reconocimiento sí/no y cinco sentence encoders, y desplazamientos de ocho personas demográficas con diferencias marginales de ESS.

Muestra: Ocho modelos abiertos, organizados en cuatro familias con variantes pequeña y grande, se evalúan en 104 escenarios VP y cuatro cuestionarios. Value Portrait contiene 520 candidatos y su validación previa reunió 681 participantes. RQ4 usa siete modelos, Gemma 3 4B se excluye por alta no respuesta bajo personas, ocho condiciones demográficas y 37.398 respuestas ESS; las comparaciones se restringen a valores porque ESS no contiene Big Five.

Hallazgos

  • La fuente vigente es arXiv:2509.10078v4, revisada el 29 de mayo de 2026, con 38 páginas y título y autoría distintos de la ficha histórica.
  • Las 38 páginas se renderizaron e inspeccionaron visualmente.
  • El PDF vigente coincide byte a byte con la caché y tiene SHA-256 21bd4cc2209ed1ece2306b146c36024317fb7979a3e88139fc887c0d82f4d127.
  • PVQ-40 frente a PVQ-21 obtiene Spearman medio 0,74 y BFI-44 frente a BFI-10 obtiene 0,77.
  • Generación frente a PVQ-40/PVQ-21 obtiene 0,31/0,28 y frente a BFI-44/BFI-10 obtiene 0,26/0,11.
  • El test exacto de cambio de signo sobre ocho modelos reporta p=0,004 para valores, p=0,016 para Big Five y p<0,001 al combinar ambos grupos.
  • La estructura entre ítems es alta en cuestionarios y cercana a la permutación en VP según eta cuadrado y varianza intraconstructo.
  • Siete modelos reconocen constructos en cuestionarios con F1 media 0,69–0,83 y en VP con 0,09; GPT-OSS 20B se excluye por respuestas nulas frecuentes.
  • Cinco encoders asignan el constructo correcto a 77–81% de los ítems establecidos y a 11–26% de los escenarios VP.
  • El mejor candidato VP ocupa mediana global 4 entre 15 respuestas y media 5,7, pero las medianas por modelo van de 1 a 11.
  • RQ4 obtiene coseno medio 0,595 para PVQ-40, 0,466 para PVQ-21 y −0,033 para VP por condición.
  • El coseno VP agregado es 0,007, IC95% [−0,221, 0,236], con p de permutación 0,957.
  • La dirección coincide en 62/80 dimensiones para PVQ-40, 55/80 para PVQ-21 y 40/80 para VP.
  • La magnitud normalizada media es 0,665 para PVQ-40, 0,711 para PVQ-21, 0,373 para VP y 0,202 para ESS.
  • No se localizó repositorio, dataset derivado o resultados crudos; el PDF promete código y datos solo tras la publicación y el trabajo sigue listado como under review.

Limitaciones

  • Value Portrait puntúa respuestas candidatas preescritas y no observa generación abierta.
  • La suma de log-probabilidades no se normaliza por longitud, por lo que respuestas más largas acumulan más penalización aunque el contenido sea comparable.
  • El paper no muestra una ablación que descarte longitud como explicación parcial de las diferencias entre candidatos o constructos.
  • Comprobar solo el mejor candidato VP no valida la representatividad de los cinco candidatos ni de todos los pares etiquetados.
  • La posición del mejor candidato VP varía mucho por modelo, con medianas de 1 a 11.
  • En 43 de 832 pares modelo-escenario quedan menos de diez muestras libres tras el filtrado.
  • La validación r ≥ 0,3 relaciona juicios humanos sobre candidatos con autoinformes humanos, no perfiles VP de LLM con conducta real observada.
  • Etiquetar un mismo candidato con múltiples constructos introduce dependencia entre scores.
  • Los conteos por constructo son desiguales: de 11 a 64 respuestas y de 9 a 45 escenarios en valores.
  • El macro y el micro promedio cambian algunas celdas de Spearman hasta aproximadamente 0,31.
  • Los cuestionarios y VP usan ítems, escalas, instrucciones y estimadores diferentes, por lo que divergencia no identifica qué método es más exacto.
  • No hay criterio externo de conducta libre con el que medir exactitud predictiva de ninguno de los dos perfiles.
  • El paper reconoce que RQ1–RQ3 carecen de baseline humano emparejado.
  • Con cinco rasgos, Spearman tiene poca resolución y las pruebas individuales tienen baja potencia.
  • Los ocho modelos no son réplicas independientes: forman cuatro familias y dos tamaños por familia.
  • El test combinado de 16 observaciones trata grupos de valores y rasgos del mismo modelo como observaciones separadas.
  • El bootstrap percentil con n=8 puede ser anticonservador, limitación reconocida por los autores.
  • NDCG asigna grados distintos a empates Likert mediante el orden de argsort de NumPy; el resultado es determinista pero no psicométricamente identificado.
  • Usar un cuestionario establecido como ranking ideal de NDCG favorece por construcción la proximidad a ese instrumento, no la verdad conductual.
  • La fila agregada de RQ2 es la mediana de ocho p-valores por modelo, no un p-valor combinado de la muestra.
  • Los tests de permutación de RQ2 reetiquetan constructos dentro del mismo conjunto de ítems y no evalúan generalización a nuevos escenarios.
  • GPT-OSS 20B se excluye de RQ3 por respuestas nulas frecuentes, pero la tasa exacta y el efecto de exclusión no se integran en la métrica principal.
  • El F1 de reconocimiento depende de prevalencias multilabel desiguales; cerca de azar no tiene el mismo valor base para cada constructo.
  • La transparencia textual está bien apoyada, pero el diseño no aísla causalmente cuánto del efecto procede de reconocimiento, deseabilidad social, alineamiento o formato Likert.
  • RQ4 usa prompts demográficos breves que invitan a estereotipos y no representan identidades o contextos completos.
  • Gemma 3 4B se excluye de RQ4 por alta no respuesta; no se ofrece un resultado end-to-end que penalice esa falta de cumplimiento.
  • Las diferencias ESS son contrastes marginales entre subgrupos y pueden mezclar país, edad, educación, ideología y otras variables.
  • No se documenta una estimación causal ni un ajuste multivariable de las diferencias humanas usadas como referencia.
  • Los 80 signos del test binomial no son independientes: los pares de persona son opuestos, el centrado fuerza dependencia y los diez valores forman un sistema correlacionado.
  • La bootstrap de RQ4 remuestrea solo ocho condiciones, una muestra pequeña y estructurada en cuatro pares.
  • Promediar deltas de siete modelos puede ocultar desacuerdo entre modelos; el apéndice muestra varianza sustancial, sobre todo en política y edad.
  • La magnitud normalizada usa la desviación entre diez valores dentro de un perfil, no una desviación entre participantes o modelos; no es Cohen’s d.
  • RQ4 solo evalúa valores de Schwartz porque ESS no aporta Big Five.
  • La comparación se limita a ocho modelos abiertos y requiere acceso a log-probabilidades de tokens.
  • No se evalúan modelos cerrados, idiomas distintos del inglés ni conversaciones multi-turno.
  • El score fijo es invariante a temperatura y paráfrasis solo porque no genera libremente; esa ventaja no prueba validez ecológica completa.
  • No se publican todavía código, datos derivados, perfiles por corrida o scripts de análisis, lo que impide reproducir las tablas.
  • El artículo está bajo revisión y no se localizó una versión publicada por pares a 15 de julio de 2026.

Qué no demuestra

  • No demuestra que los cuestionarios humanos carezcan de toda utilidad para estudiar LLM.
  • No demuestra que el perfil VP sea una medida más exacta de conducta real que los cuestionarios.
  • No demuestra que las probabilidades sobre candidatos fijos predigan generación libre.
  • No demuestra que la divergencia entre métodos sea exclusiva de LLM o mayor que en humanos.
  • No demuestra causalmente que transparencia léxica o deseabilidad social expliquen por sí solas la estructura observada.
  • No valida que cada etiqueta r ≥ 0,3 represente un constructo único o estable en todos los contextos.
  • No demuestra independencia estadística de modelos, constructos, condiciones demográficas o signos.
  • No demuestra que personas breves simulen identidades demográficas humanas completas.
  • No demuestra que las diferencias ESS sean efectos causales de género, edad, ideología o educación.
  • No permite reproducir los resultados sin los artefactos prometidos tras publicación.
  • No justifica usar ninguno de los perfiles como diagnóstico psicológico o criterio de seguridad por sí solo.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2509.10078v4, initially submitted 12 September 2025, revised 29 May 2026, 38 pages

Fuente consultada: https://arxiv.org/abs/2509.10078

Revisión: Codex complete bilingual full-text fidelity pass, current arXiv-v4 metadata reconciliation, all-page PDF visual inspection, generation-probability scoring audit, rank and tie-handling audit, item-structure and construct-recognition assessment, persona/ESS inference audit, and artifact-availability check; summaries written from the full paper and reported appendices rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Gemma 3 4B instruction-tuned
  • Gemma 3 27B instruction-tuned
  • Qwen 2.5 7B Instruct
  • Qwen 2.5 72B Instruct
  • Qwen 3 30B-A3B Instruct 2507
  • Qwen 3 235B-A22B Instruct 2507 in the official FP8 storage checkpoint
  • GPT-OSS 20B
  • GPT-OSS 120B
  • All inference with vLLM 0.16.0 and default Hugging Face chat templates; float16 weights except the stored FP8 Qwen 3 235B checkpoint, bfloat16 compute

Instrumentos y métricas

  • Portrait Values Questionnaire PVQ-40 and PVQ-21
  • Big Five Inventory BFI-44 and BFI-10
  • Two reversed Likert option-order prompt variants
  • Value Portrait generation-probability scoring over fixed candidate responses
  • Spearman rank correlation and full-list NDCG
  • Eta-squared and z-scored within-construct mean variance
  • LLM binary item-construct recognition with mean F1
  • Five sentence-embedding families for top-1 construct assignment, discrimination and clustering gap
  • Cosine similarity, direction agreement, bootstrap, permutation and within-profile normalized shift magnitude for persona deltas

Datos utilizados

  • Value Portrait: 104 real-world queries, five candidates each, 520 query-response pairs
  • Value Portrait validation: 681 human participants and about 46 ratings per query-response pair
  • 286 value-tagged and 228 trait-tagged item-construct pairs at Pearson r ≥ 0.3
  • Source queries from ShareGPT, LMSYS-Chat-1M, Reddit advisory data and Dear Abby
  • European Social Survey round 11 integrated file edition 4.1: 37,398 respondents across 29 European countries plus Israel for RQ4
  • No released snapshot of this study’s code, derived profiles, prompts-as-run, model outputs or analysis tables was located

Evidencia y localización

  • Versión, título, autores, fecha y promesa de artefactos: arXiv:2509.10078v4 title page, page 1; metadata checked 15 July 2026
  • Diseño de cuestionarios, Value Portrait, modelos y scoring: Sections 3.1–3.3, pages 3–4; Appendices B–C, pages 11–13
  • Rankings y tests RQ1: Section 4.1 and Table 2, pages 4–5; Appendices F.1–F.3 and Tables 8–10, pages 17–19
  • Estructura de constructos RQ2: Section 4.2 and Table 3, pages 5–6; Appendix G.1 and Tables 15–20, pages 21–23
  • Transparencia textual y reconocimiento RQ3: Section 4.3, Figure 1 and Table 4, pages 6–7; Appendix H, pages 24–29
  • Personas, referencia ESS, cosenos, dirección y magnitud: Section 4.4 and Table 5, pages 7–8; Appendix I and Tables 28–39, pages 30–38
  • Limitaciones reconocidas por los autores: Limitations, page 9
  • Inspección visual completa: All 38 pages of arXiv:2509.10078v4 rendered and visually inspected on 15 July 2026
  • Estado de artefactos: Paper, exact-title, arXiv-ID, GitHub, Hugging Face and official author-page checks on 15 July 2026
  • Auditoría metodológica y reconciliación de metadatos: reports/verification/article-182-method-and-metadata-audit.json