Rethinking psychometrics through LLMs: how item semantics shape measurement and prediction in psychological questionnaires

Evaluación y validez psicométrica2025Scientific ReportsRevisión editorial aprobada

Autores: Federico Ravenda, Antonio Preti, Michele Poletti, Antonietta Mira, Andrea Raballo

Palabras clave: Psychometrics, Questionnaire semantics, Semantic similarity, Big Five, DASS-42, GAD-7, PHQ-9, PsychoLLM, Construct validity, Reproducibility

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
15
Hallazgos
27
Limitaciones
11
Evidencias

Resumen editorial

Español

Rethinking psychometrics through LLMs estudia si la similitud lingüística entre ítems de cuestionarios se parece a la estructura de correlaciones de respuestas humanas y si esa relación permite predecir respuestas a ítems nuevos. No evalúa personalidad sintética ni rasgos internos de un LLM: usa representaciones textuales preentrenadas para analizar datos psicométricos humanos. En Big Five se parte de 1.015.341 respuestas web y en DASS-42 de 39.775; para la predicción se toman 1.000 observaciones de cada fuente. Se comparan diez representaciones: BERT, RoBERTa, DistilBERT, tres Sentence-BERT, T5 y tres APIs de embeddings de OpenAI. Para cada par de ítems se calcula coseno semántico y se contrasta con la magnitud de su correlación empírica. Con text-embedding-3-large, el ítem más correlacionado aparece entre los tres vecinos semánticos en 95,2 % de los 42 ítems DASS y 82,0 % de los 50 Big Five. En DASS se reportan Pearson r=0,77 y Spearman rho=0,73; en Big Five, r=0,67 y rho=0,64. Es evidencia útil de correspondencia entre redacción y covariación, pero no identifica causalidad: los ítems se diseñan deliberadamente para expresar facetas relacionadas y comparten contenido de constructo. El artículo también fuerza tres factores sobre la matriz semántica DASS, rota con varimax y muestra loadings agrupados por las subescalas teóricas. Sin criterio independiente para elegir tres factores, congruencia, fit, null o validación externa, ilustra alineamiento pero no prueba que el análisis semántico descubra por sí solo la estructura ni que la semántica predetermine el constructo. PsychoLLM es una red ligera: selecciona los tres ítems más similares al target, transforma seis similitudes mediante Dense(10, GELU) y softmax de tres pesos, combina las tres respuestas y aplica una capa ordinal. El suplemento declara learning rate 0,01, batch 32 y tres epochs. En Leave-One-Item-Out, PsychoLLM obtiene MAE/MAPE 0,54/0,28 en DASS, prácticamente empatado con gradient boosting 0,55/0,28 y algo peor que random forest 0,53/0,26. En Big Five obtiene 0,78/0,35, peor que random forest 0,70/0,30 y gradient boosting 0,72/0,30. El LOSO adicional predice cada subescala DASS desde las otras dos con MAE 0,50-0,60. En C19PRC Wave 6, entrenar con PHQ-9 para predecir GAD-7 produce MAE 0,34 y 71 % de exact match; en sentido inverso, MAE 0,36 y 70 %. Esos dos instrumentos miden síntomas relacionados, comparten escala de cuatro categorías y proceden de la misma ola. No se informa el N analizado ni un baseline de clase mayoritaria, moda por ítem, nearest item o balanced accuracy. Por tanto, el 70-71 % headline no demuestra mejora sobre una regla trivial y puede estar impulsado por la abundancia de respuestas cero. Hay una limitación conceptual decisiva: el paper llama a PsychoLLM unsupervised y afirma que no necesita labeled training data, pero el suplemento dice explícitamente que optimiza cross-entropy entre respuestas predichas y reales. Para cada ítem no target usa scores humanos reales como etiquetas; solo permanece sin ver la etiqueta del ítem objetivo. Es self-supervised transfer entre ítems, no aprendizaje sin labels ni sin recogida de respuestas. Además, los baselines supervisados usan cinco folds por participantes, mientras PsychoLLM se entrena con otros ítems de los mismos 1.000 participantes sobre los que evalúa el target; no hay holdout de personas claramente descrito. La comparación no aísla generalización a nuevos respondents y no está emparejada en protocolo. La auditoría del repositorio oficial refuerza la cautela. Existe código y material público valioso en main commit 9c7e501: datos DASS, matrices de embeddings de 3.072 dimensiones, PsychoLLM y varios scripts. Pero no es una reproducción ejecutable. Falta requirements/lockfile, entorno, licencia, instrucciones, raw Big Five, respuestas C19PRC, código PHQ/GAD, baselines, factor analysis, LOSO, outputs y weights. sentence_embeddings.py ni siquiera compila por un paréntesis sin cerrar y contiene placeholders/nombres sin definir. Otros scripts usan TensorFlow antes de importarlo, llaman compile/fit sobre un wrapper que no expone esos métodos y esperan archivos ausentes. El script Big Five declara cuatro clases aunque el cuestionario usa cinco y fija embedding_dim=768 frente a los CSV de 3.072 columnas. Tampoco implementa el reverse scoring prometido. El código Top-K usa correlación con signo, no el valor absoluto declarado; la fórmula ordinal del suplemento tiene signo opuesto a la capa publicada; y el código suma uno antes de MAPE aunque el suplemento imprime la fórmula estándar, indefinida cuando y=0. Estas discrepancias pueden cambiar resultados y bloquean su recomputación. La conclusión fiel es que embeddings preentrenados capturan información útil sobre redundancia y covariación de ítems en estos cuestionarios ingleses, y que transferir scores de vecinos semánticos merece estudio. No se demuestra que el lenguaje cree o predetermine constructos psicológicos, que PsychoLLM sea label-free, que el 70 % supere baselines simples, que generalice a nuevas personas o que el artefacto publicado reproduzca las tablas. Para afirmaciones más fuertes hacen falta intervención causal sobre wording, inferencia consciente de dependencia matricial, holdout de participantes, baselines y prevalencias, métricas válidas con ceros, instrumentos/idiomas/escalas diversos y un release ejecutable versionado.

English

Rethinking psychometrics through LLMs asks whether linguistic similarity among questionnaire items resembles the correlation structure of human responses and whether that relationship can predict responses to new items. It does not evaluate synthetic personality or an internal LLM trait: pretrained text representations are used to analyze human psychometric data. The matrix analyses use 1,015,341 web responses for a 50-item Big Five questionnaire and 39,775 for DASS-42; 1,000 observations from each source are sampled for prediction. Ten representations are compared: BERT, RoBERTa, DistilBERT, three Sentence-BERT models, T5 and three OpenAI embedding APIs. Pairwise cosine similarity is compared with the magnitude of empirical item correlation. With text-embedding-3-large, the most correlated item is among the three nearest semantic neighbors for 95.2% of the 42 DASS items and 82.0% of the 50 Big Five items. DASS results are Pearson r=0.77 and Spearman rho=0.73; Big Five results are r=0.67 and rho=0.64. This is useful evidence of correspondence between wording and covariance, but it does not identify causality: questionnaire items are deliberately written to express related facets and share construct content. The paper also forces three factors on the DASS semantic matrix, applies varimax rotation and displays loadings grouped by theoretical subscale. Without an independent factor-number criterion, congruence statistic, fit measure, null matrix or external validation, this illustrates alignment but does not show that semantic analysis independently discovers the structure or that semantics predetermines the construct. PsychoLLM is a lightweight network. It selects the target's three most similar items, transforms six similarities through a Dense(10, GELU) layer and a three-weight softmax, combines the three observed responses, and applies a custom ordinal layer. The supplement states learning rate 0.01, batch size 32 and three epochs. In Leave-One-Item-Out evaluation, PsychoLLM reaches MAE/MAPE 0.54/0.28 on DASS, nearly tied with gradient boosting at 0.55/0.28 and slightly worse than random forest at 0.53/0.26. On Big Five it reaches 0.78/0.35, worse than random forest at 0.70/0.30 and gradient boosting at 0.72/0.30. An additional LOSO analysis predicts each DASS subscale from the other two with MAE 0.50-0.60. On C19PRC Wave 6, training on PHQ-9 to predict GAD-7 yields MAE 0.34 and 71% exact match; the reverse direction yields MAE 0.36 and 70%. These instruments assess related symptoms, use the same four-category scale and come from the same survey wave. The analyzed N and any majority-class, item-mode, nearest-item or balanced-accuracy baseline are absent. Consequently, the headline 70-71% does not demonstrate improvement over a trivial rule and may be driven by frequent zero responses. A decisive conceptual limitation is that the paper calls PsychoLLM unsupervised and says it does not require labeled training data, while the supplement explicitly states that it optimizes cross-entropy between predicted and actual responses. For every non-target item, real human scores serve as training labels; only the target-item labels are unseen. This is self-supervised transfer across items, not label-free learning or prediction without collected responses. In addition, supervised baselines use five respondent folds, whereas PsychoLLM is trained on other items from the same 1,000 respondents whose target item it evaluates; no clear person-level holdout is described. The comparison therefore does not isolate generalization to new respondents and is not protocol-matched. The official repository audit adds further caution. Useful public materials exist at main commit 9c7e501: DASS data, 3,072-dimensional embedding matrices, a PsychoLLM implementation and several scripts. But this is not an executable reproduction. It lacks a requirements/lockfile, environment, license, instructions, raw Big Five responses, C19PRC responses, PHQ/GAD experiment code, baselines, factor analysis, LOSO, outputs and weights. sentence_embeddings.py fails syntax compilation because of an unclosed parenthesis and contains placeholders or undefined names. Other scripts use TensorFlow before importing it, call compile/fit on a wrapper that exposes neither method, and expect absent files. The Big Five script declares four classes although the questionnaire uses five, and hard-codes embedding_dim=768 against committed 3,072-column CSVs. It does not implement the promised reverse scoring. Top-K code uses signed rather than stated absolute correlations; the supplement's ordinal formula has the opposite sign from the published layer; and the repository adds one before MAPE although the supplement prints the standard formula, which is undefined at y=0. These discrepancies can change results and block recomputation. The faithful conclusion is that pretrained embeddings contain useful information about item redundancy and covariance in these English questionnaires, and score transfer from semantic neighbors deserves further study. The paper does not show that language creates or predetermines psychological constructs, that PsychoLLM is label-free, that 70% beats simple baselines, that the model generalizes to new people, or that the released artifact reproduces the tables. Stronger claims require causal wording interventions, matrix-dependence-aware inference, respondent holdout, prevalence and baselines, zero-safe metrics, diverse instruments/languages/scales, and a versioned executable release.

Pregunta de investigación

¿Hasta qué punto la similitud semántica entre ítems de cuestionarios reproduce su correlación empírica, y puede una arquitectura que combina embeddings y respuestas de ítems vecinos predecir scores de ítems o cuestionarios no vistos?

Método

Se comparan matrices de coseno de diez modelos de representación con matrices de correlación absoluta de Big Five-50 y DASS-42 mediante Top-K, Pearson y Spearman. Se ilustra una solución semántica DASS de tres factores. PsychoLLM recibe seis similitudes entre target y tres vecinos, aprende tres pesos con Dense(10)-GELU/softmax y aplica una capa ordinal a las respuestas ponderadas. Se evalúa Leave-One-Item-Out sobre 1.000 casos por cuestionario, LOSO en DASS y transferencia PHQ-9/GAD-7 en C19PRC Wave 6. La auditoría leyó y renderizó las 12 páginas del artículo y las 10 del suplemento, verificó metadatos, fórmulas, tablas, protocolo y claims, e inventarió, compiló y contrastó el repositorio oficial en el commit publicado de main.

Muestra: Para matrices se declaran 1.015.341 respuestas Big Five y 39.775 DASS de participación web voluntaria. Para Leave-One-Item-Out se muestrean aleatoriamente 1.000 casos de cada dataset. Para PHQ-9/GAD-7 se usa C19PRC Wave 6, pero el N analizado no aparece. No se publica un holdout independiente de participantes para PsychoLLM ni análisis demográfico, de representatividad o de calidad de respuestas.

Hallazgos

  • text-embedding-3-large alcanza Top-3 95,2 % en DASS y 82,0 % en Big Five.
  • En DASS obtiene Pearson r=0,77 y Spearman rho=0,73; en Big Five r=0,67 y rho=0,64.
  • El conjunto de modelos muestra una asociación semántica-respuesta positiva, con variación considerable entre representaciones.
  • PsychoLLM obtiene MAE/MAPE 0,54/0,28 en DASS, cerca de los ensembles.
  • En Big Five PsychoLLM 0,78/0,35 queda por detrás de random forest 0,70/0,30 y gradient boosting 0,72/0,30.
  • LOSO DASS produce MAE 0,50 para Depresión, 0,60 para Ansiedad y 0,57 para Estrés.
  • PHQ-9 a GAD-7 reporta 71 % exact match y MAE 0,34; GAD-7 a PHQ-9, 70 % y 0,36.
  • El 70-71 % carece de baseline de prevalencia, moda por ítem o balanced accuracy.
  • PsychoLLM usa respuestas reales como labels de los ítems no target; no es label-free.
  • La evaluación no documenta holdout de nuevos participantes para PsychoLLM.
  • La asociación observacional no demuestra que la semántica cause o predetermine el constructo.
  • La solución DASS fija tres factores conocidos y no cuantifica recuperación independiente.
  • El repositorio oficial contiene DASS, embeddings y código parcial, pero no reproduce las tablas.
  • El código publicado tiene fallos de sintaxis/runtime y contradicciones materiales con artículo y suplemento.
  • El trabajo es psicometría de respuestas humanas asistida por embeddings, no evidencia de personalidad en un LLM.

Limitaciones

  • Solo se evalúan dos instrumentos en la fase matriz y escalas relacionadas en la transferencia.
  • Todo el material textual es inglés.
  • Las muestras OpenPsychometrics son web, opt-in y no se demuestra representatividad.
  • Se excluye demografía y no hay análisis de subgrupos, cultura o response quality.
  • La correlación semántica-respuesta comparte contenido de constructo y no identifica causalidad.
  • No hay intervención con paraphrases, wording aleatorio, negaciones controladas o ítems emparejados.
  • Las celdas de matrices no son independientes y los p-values estándar no corrigen esa dependencia.
  • No se informa multiplicidad pese a múltiples modelos, métricas e instrumentos.
  • La factoración DASS fija a priori tres factores y agrupa por subescala teórica.
  • Faltan parallel analysis, fit, congruence, null y cross-validation factorial.
  • PsychoLLM se describe como unsupervised/label-free aunque optimiza con scores humanos reales.
  • No hay holdout claro de participantes para PsychoLLM.
  • Los baselines usan cinco folds y no queda demostrado un protocolo comparable.
  • El exact match PHQ/GAD no incluye distribución por clases ni majority baseline.
  • PHQ-9 y GAD-7 comparten cuatro categorías y constructos clínicos relacionados.
  • El N C19PRC analizado no se informa.
  • MAPE con scores cero requiere convención; código y suplemento no coinciden.
  • Los thresholds ordinales del código no están ordenados y la dirección de la fórmula difiere.
  • No hay preregistro, power, intervalos o validación externa independiente.
  • El repositorio no tiene requirements, lockfile, environment, licencia ni instrucciones.
  • Faltan raw Big Five, C19PRC, baselines, factor analysis, LOSO, outputs y weights.
  • sentence_embeddings.py no compila y contiene placeholders/nombres sin definir.
  • El pipeline Big Five usa cuatro clases y dimensión 768 frente a cinco clases y embeddings 3.072.
  • El reverse scoring declarado para Big Five no aparece en el código publicado.
  • Top-K, signo ordinal y MAPE muestran discrepancias paper-código.
  • No hay tag/release inmutable; el último commit main auditado es anterior a la publicación.
  • Se llama LLM a una mezcla de encoders, sentence transformers, T5 y APIs de embeddings.

Qué no demuestra

  • No demuestra que la semántica cree o predetermine constructos psicológicos.
  • No demuestra que factor analysis recupere principalmente artefactos lingüísticos.
  • No demuestra aprendizaje sin labels ni sin respuestas humanas.
  • No demuestra que 70-71 % supere una regla de clase mayoritaria o moda.
  • No demuestra ventaja frente a baselines bajo el mismo protocolo.
  • No demuestra generalización a participantes nuevos.
  • No demuestra transferencia a escalas, constructos, idiomas o culturas heterogéneos.
  • No demuestra que los MAPE sigan la fórmula impresa.
  • No demuestra que el código publicado produzca las tablas.
  • No demuestra que el reverse scoring Big Five se ejecutara como se afirma.
  • No demuestra que tres factores DASS se descubrieran sin conocimiento previo.
  • No atribuye los resultados específicamente a razonamiento de LLM generativo.
  • No demuestra personalidad, estado mental o rasgo interno en ningún LLM.
  • No generaliza la muestra web opt-in a población general.

Trazabilidad

Alcance: Texto completo

Versión: Scientific Reports version of record, volume 15 article 37313, published 24 October 2025; audited with the official 10-page supplement and official GitHub main commit 9c7e50136b67154205eba94d12c9abfe9c9fad75

Fuente consultada: https://doi.org/10.1038/s41598-025-21289-8

Revisión: Codex complete bilingual fidelity pass using the full 12-page Scientific Reports version of record and 10-page official supplement, all-page visual inspection, official metadata and DOI verification, full method/table/formula/claim audit, and inventory, syntax check and paper-code consistency review of the official GitHub repository at immutable main commit 9c7e50136b67154205eba94d12c9abfe9c9fad75; summaries written from full evidence rather than abstract keywords, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • all-MiniLM-L6-v2
  • all-MiniLM-L12-v2
  • all-mpnet-base-v2
  • BERT
  • RoBERTa
  • DistilBERT
  • text-embedding-3-small
  • text-embedding-3-large
  • text-embedding-ada-002
  • T5
  • PsychoLLM custom dense-plus-ordinal architecture
  • Feed-forward neural network baseline
  • Random forest baseline
  • Gradient boosting baseline

Instrumentos y métricas

  • 50-item Big Five questionnaire from OpenPsychometrics
  • DASS-42
  • GAD-7
  • PHQ-9
  • Cosine semantic similarity
  • Top-1, Top-2 and Top-3 retrieval
  • Pearson and Spearman matrix-entry correlations
  • MAE
  • MAPE
  • Exact response match
  • Leave-One-Item-Out
  • Leave-One-Subscale-Out

Datos utilizados

  • OpenPsychometrics Big Five raw dataset: 1,015,341 respondents reported; not included in the official repository
  • OpenPsychometrics DASS raw dataset: 39,775 respondents; included in the official repository
  • C19PRC Wave 6 PHQ-9 and GAD-7 responses from OSF; analyzed N not reported and response data not included in GitHub
  • Committed 3,072-dimensional Big Five and DASS text-embedding-3-large matrices
  • Official repository at main commit 9c7e50136b67154205eba94d12c9abfe9c9fad75

Evidencia y localización

  • Metadatos, abstract, datasets y modelos semánticos: Scientific Reports version of record pages 1-4; DOI 10.1038/s41598-025-21289-8
  • Top-K y correlaciones por modelo: Version of record pages 4-5, Figure 2 and Table 1
  • Arquitectura PsychoLLM y evaluación de ítem nuevo: Version of record pages 6-7, Figure 3 and Table 2; Supplementary pages 5-7
  • LOSO DASS: Version of record pages 7-8, Figures 4-5
  • Transferencia PHQ-9/GAD-7 y 70-71%: Version of record pages 8-9, Table 3; Supplementary page 10
  • Limitaciones y alcance causal/epistemológico: Version of record pages 9-10, Discussion, Implications and Conclusions
  • Datos, código y fechas oficiales: Version of record pages 11-12 and official Nature article metadata checked 16 July 2026
  • Factor analysis, MAPE, training labels, hyperparameters y negación: Official Supplementary Information pages 3-7
  • Auditoría de código y completitud de artefactos: Official GitHub repository main commit 9c7e50136b67154205eba94d12c9abfe9c9fad75; file inventory, Python compile check and paper-code comparison on 16 July 2026
  • Informe integral de validez y reproducibilidad: reports/verification/article-207-questionnaire-semantics-psychollm-validity-and-reproducibility-audit.json
  • Inspección visual completa: All 12 version-of-record pages and all 10 supplementary pages rendered and visually inspected on 16 July 2026