Rethinking psychometrics through LLMs estudia si la similitud lingüística entre ítems de cuestionarios se parece a la estructura de correlaciones de respuestas humanas y si esa relación permite predecir respuestas a ítems nuevos. No evalúa personalidad sintética ni rasgos internos de un LLM: usa representaciones textuales preentrenadas para analizar datos psicométricos humanos. En Big Five se parte de 1.015.341 respuestas web y en DASS-42 de 39.775; para la predicción se toman 1.000 observaciones de cada fuente. Se comparan diez representaciones: BERT, RoBERTa, DistilBERT, tres Sentence-BERT, T5 y tres APIs de embeddings de OpenAI. Para cada par de ítems se calcula coseno semántico y se contrasta con la magnitud de su correlación empírica. Con text-embedding-3-large, el ítem más correlacionado aparece entre los tres vecinos semánticos en 95,2 % de los 42 ítems DASS y 82,0 % de los 50 Big Five. En DASS se reportan Pearson r=0,77 y Spearman rho=0,73; en Big Five, r=0,67 y rho=0,64. Es evidencia útil de correspondencia entre redacción y covariación, pero no identifica causalidad: los ítems se diseñan deliberadamente para expresar facetas relacionadas y comparten contenido de constructo. El artículo también fuerza tres factores sobre la matriz semántica DASS, rota con varimax y muestra loadings agrupados por las subescalas teóricas. Sin criterio independiente para elegir tres factores, congruencia, fit, null o validación externa, ilustra alineamiento pero no prueba que el análisis semántico descubra por sí solo la estructura ni que la semántica predetermine el constructo. PsychoLLM es una red ligera: selecciona los tres ítems más similares al target, transforma seis similitudes mediante Dense(10, GELU) y softmax de tres pesos, combina las tres respuestas y aplica una capa ordinal. El suplemento declara learning rate 0,01, batch 32 y tres epochs. En Leave-One-Item-Out, PsychoLLM obtiene MAE/MAPE 0,54/0,28 en DASS, prácticamente empatado con gradient boosting 0,55/0,28 y algo peor que random forest 0,53/0,26. En Big Five obtiene 0,78/0,35, peor que random forest 0,70/0,30 y gradient boosting 0,72/0,30. El LOSO adicional predice cada subescala DASS desde las otras dos con MAE 0,50-0,60. En C19PRC Wave 6, entrenar con PHQ-9 para predecir GAD-7 produce MAE 0,34 y 71 % de exact match; en sentido inverso, MAE 0,36 y 70 %. Esos dos instrumentos miden síntomas relacionados, comparten escala de cuatro categorías y proceden de la misma ola. No se informa el N analizado ni un baseline de clase mayoritaria, moda por ítem, nearest item o balanced accuracy. Por tanto, el 70-71 % headline no demuestra mejora sobre una regla trivial y puede estar impulsado por la abundancia de respuestas cero. Hay una limitación conceptual decisiva: el paper llama a PsychoLLM unsupervised y afirma que no necesita labeled training data, pero el suplemento dice explícitamente que optimiza cross-entropy entre respuestas predichas y reales. Para cada ítem no target usa scores humanos reales como etiquetas; solo permanece sin ver la etiqueta del ítem objetivo. Es self-supervised transfer entre ítems, no aprendizaje sin labels ni sin recogida de respuestas. Además, los baselines supervisados usan cinco folds por participantes, mientras PsychoLLM se entrena con otros ítems de los mismos 1.000 participantes sobre los que evalúa el target; no hay holdout de personas claramente descrito. La comparación no aísla generalización a nuevos respondents y no está emparejada en protocolo. La auditoría del repositorio oficial refuerza la cautela. Existe código y material público valioso en main commit 9c7e501: datos DASS, matrices de embeddings de 3.072 dimensiones, PsychoLLM y varios scripts. Pero no es una reproducción ejecutable. Falta requirements/lockfile, entorno, licencia, instrucciones, raw Big Five, respuestas C19PRC, código PHQ/GAD, baselines, factor analysis, LOSO, outputs y weights. sentence_embeddings.py ni siquiera compila por un paréntesis sin cerrar y contiene placeholders/nombres sin definir. Otros scripts usan TensorFlow antes de importarlo, llaman compile/fit sobre un wrapper que no expone esos métodos y esperan archivos ausentes. El script Big Five declara cuatro clases aunque el cuestionario usa cinco y fija embedding_dim=768 frente a los CSV de 3.072 columnas. Tampoco implementa el reverse scoring prometido. El código Top-K usa correlación con signo, no el valor absoluto declarado; la fórmula ordinal del suplemento tiene signo opuesto a la capa publicada; y el código suma uno antes de MAPE aunque el suplemento imprime la fórmula estándar, indefinida cuando y=0. Estas discrepancias pueden cambiar resultados y bloquean su recomputación. La conclusión fiel es que embeddings preentrenados capturan información útil sobre redundancia y covariación de ítems en estos cuestionarios ingleses, y que transferir scores de vecinos semánticos merece estudio. No se demuestra que el lenguaje cree o predetermine constructos psicológicos, que PsychoLLM sea label-free, que el 70 % supere baselines simples, que generalice a nuevas personas o que el artefacto publicado reproduzca las tablas. Para afirmaciones más fuertes hacen falta intervención causal sobre wording, inferencia consciente de dependencia matricial, holdout de participantes, baselines y prevalencias, métricas válidas con ceros, instrumentos/idiomas/escalas diversos y un release ejecutable versionado.
Pregunta de investigación
¿Hasta qué punto la similitud semántica entre ítems de cuestionarios reproduce su correlación empírica, y puede una arquitectura que combina embeddings y respuestas de ítems vecinos predecir scores de ítems o cuestionarios no vistos?