AI can outperform humans in predicting correlations between personality items

Evaluación y validez psicométrica2025Nature / Scientific ReportsRevisión editorial aprobada

Autores: Philipp Schoenegger, Spencer Greenberg, Alexander Grishin, Joshua Lewis, Lucius Caviola

Palabras clave: Personality Items, Correlation Forecasting, Large Language Models, Psychometrics, Wisdom of Crowds

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
18
Hallazgos
24
Limitaciones
8
Evidencias

Resumen editorial

Español

Schoenegger y coautores estudian una tarea estrecha pero útil: estimar la correlación empírica entre dos ítems de personalidad sin recoger nuevas respuestas al cuestionario. El conjunto contiene 249 pares de 103 ítems de SAPA. No es una muestra natural de correlaciones: se construyó con un tercio por debajo de −0,2, un tercio entre −0,2 y 0,2 y un tercio por encima de 0,2. Comparan 254 personas no expertas, 272 académicos de psicología o ciencias del comportamiento, tres ejecuciones de GPT-4o a temperatura 0, tres de Claude 3 Opus, y una predicción determinista de PersonalityMap, una red propietaria entrenada específicamente con pares de ítems. Cada persona contestó 30 pares asignados al azar, salvo algunos legos incompletos, mientras cada sistema cubrió los 249.

En las comparaciones individuales, una ejecución seleccionada con seed fijo de GPT-4o tuvo error absoluto medio 0,14, Claude 0,11 y PersonalityMap 0,07, frente a medias por participante de 0,29 en legos y 0,20 en expertos. GPT-4o quedó en el percentil 95,67 frente a legos y 70,22 frente a expertos; Claude, en 100 y 95,22; PersonalityMap, en 100 frente a ambos. Los win rates, calculados sobre los pares realmente contestados por cada persona, fueron 90,94%/69,85% para GPT-4o, 97,64%/86,40% para Claude y 100%/99,26% para PersonalityMap frente a legos/expertos. Esto respalda que una consulta de estos sistemas suele ser más precisa que un individuo en esta tarea. No prueba una comprensión general de la personalidad: predice parámetros de ítems conocidos y la comparación individual da a la IA 249 pares, pero a cada humano solo 30.

Cuando se agrega por ítem mediante la mediana, la ventaja cambia. El error medio fue 0,164 para legos, 0,086 para expertos, 0,140 para GPT-4o, 0,104 para Claude y 0,072 para PersonalityMap. Las correlaciones entre predicción y valor empírico fueron 0,88, 0,90, 0,78, 0,80 y 0,91, respectivamente. El test de buckets (<−0,1, −0,1 a 0,1, >0,1) no encontró diferencias, χ²(4)=6,42, p=.170. Sin embargo, las pruebas publicadas de error tratan como independientes cinco medidas sobre los mismos 249 pares: usan Kruskal–Wallis y llaman “Dunn” a comparaciones Mann–Whitney con Paired=False. Una comprobación editorial emparejada produce Friedman χ²(4)=96,59, p<.001 y Wilcoxon-Holm: confirma la superioridad general de PersonalityMap y Claude sobre GPT-4o, pero cambia dos conclusiones límite, GPT-4o frente a legos pasa a p=.047 y PersonalityMap frente a expertos a p=.047, mientras expertos frente a Claude queda en p=.053. Para los buckets, el Cochran Q emparejado sigue sin ser significativo, Q(4)=8,70, p=.069. Estas comprobaciones no sustituyen una revisión estadística formal, pero muestran que parte del detalle inferencial depende de haber ignorado el emparejamiento.

Los análisis añadidos tras la primera revisión por pares prueban 30 consultas no sembradas de GPT-4o a temperatura 1 y SurveyBot3000. La mediana de las 30 consultas mejora la correlación agregada de GPT-4o hasta 0,88, sin mejorar de forma uniforme las otras métricas. SurveyBot3000 parece competitivo, pero fue entrenado con SAPA y por tanto con el propio conjunto usado como test; los autores reconocen que no permite distinguir generalización de memorización. La lectura del peer review transparente confirma que el título se estrechó de “entender personalidad” a “predecir correlaciones entre ítems” y que los revisores pidieron reducir las aplicaciones especulativas.

El artefacto OSF permite reproducir las cifras principales, pero no es una reproducción de extremo a extremo. Incluye dos Excel procesados, dos scripts monolíticos y dos JSON de verdad, sin README, requirements, lockfile, CLI ni código para recopilar respuestas de los LLM o ejecutar PersonalityMap. Los paths son XXX/...; tras reconstruirlos y usar las versiones declaradas en el reporting summary, el script principal termina y reproduce las tablas. El script adicional también termina, pero fija num_bootstraps = 10 aunque el artículo declara 10.000, genera intervalos distintos de los publicados y produce CIs nan para dos condiciones improcedentes. Ambos scripts imprimen el p-valor como si fuera también el estadístico W de Shapiro o F de Levene. PersonalityMap sigue siendo propietario: dos autores lo crearon y uno fundó además Positly y GuidedTrack, un conflicto declarado; la afirmación de que ningún ítem de test entró en su entrenamiento no puede comprobarse con el depósito.

La contribución defendible es demostrar que los pronósticos sintéticos de correlaciones pueden ser baratos y sorprendentemente precisos, y que agregar expertos humanos sigue siendo competitivo con LLM generales. El alcance correcto es la predicción de correlaciones lineales, transversales y de autoinforme en un inventario inglés y una distribución de test artificialmente estratificada. No valida selección de personal, diagnóstico, marketing, evaluación psicológica automatizada ni sustitución de datos humanos. Tampoco convierte una correlación predicha en evidencia causal: los propios autores señalan que cualquier uso científico debe confirmarse finalmente con personas reales y que faltan estimaciones de incertidumbre para PersonalityMap.

English

Schoenegger and coauthors study a narrow but useful task: estimating the empirical correlation between two personality items without collecting new questionnaire responses. The benchmark contains 249 pairs drawn from 103 SAPA items. It is not a natural sample of correlations: one third was selected below −0.2, one third between −0.2 and 0.2, and one third above 0.2. The study compares 254 laypeople, 272 psychology or behavioral-science academics, three temperature-zero GPT-4o runs, three Claude 3 Opus runs, and one deterministic prediction from PersonalityMap, a proprietary network trained specifically on item pairs. Each human judged 30 randomly assigned pairs, apart from some incomplete lay responses, whereas every AI system covered all 249.

In individual comparisons, the seeded randomly selected GPT-4o run had mean absolute error 0.14, Claude 0.11, and PersonalityMap 0.07, compared with participant-level means of 0.29 for laypeople and 0.20 for experts. GPT-4o ranked at the 95.67th percentile against laypeople and 70.22nd against experts; Claude ranked at 100 and 95.22; PersonalityMap ranked at 100 against both. Win rates over the items actually answered by each person were 90.94%/69.85% for GPT-4o, 97.64%/86.40% for Claude, and 100%/99.26% for PersonalityMap against laypeople/experts. This supports the claim that one query to these systems is usually more accurate than one individual on this task. It does not establish broad personality understanding: the target is an item-level population parameter, and the individual comparison gives each AI 249 pairs while each human sees only 30.

Median aggregation by item changes the comparison. Mean error is 0.164 for laypeople, 0.086 for experts, 0.140 for GPT-4o, 0.104 for Claude, and 0.072 for PersonalityMap. Correlations between aggregate predictions and empirical values are 0.88, 0.90, 0.78, 0.80, and 0.91, respectively. The three-bucket test (<−0.1, −0.1 to 0.1, >0.1) reports no group difference, χ²(4)=6.42, p=.170. The published error tests, however, treat five measurements on the same 249 pairs as independent: they use Kruskal–Wallis and label Paired=False Mann–Whitney comparisons as “Dunn’s test.” An editorial paired robustness check yields Friedman χ²(4)=96.59, p<.001 and Holm-adjusted Wilcoxon tests. It preserves the broad ranking but changes two borderline conclusions, GPT-4o versus laypeople becomes p=.047 and PersonalityMap versus experts p=.047, while experts versus Claude becomes p=.053. A paired Cochran Q test still finds no bucket difference, Q(4)=8.70, p=.069. These checks are not a substitute for a formal statistical reanalysis, but they show that some inferential detail depends on ignoring the paired design.

Analyses added after first-round peer review test 30 unseeded GPT-4o queries at temperature 1 and SurveyBot3000. Aggregating 30 higher-temperature runs raises GPT-4o’s prediction–truth correlation to 0.88 without uniformly improving the other metrics. SurveyBot3000 appears competitive, but it was trained on SAPA and therefore on the benchmark used here; the authors correctly state that its result cannot distinguish generalization from memorization. The transparent review record also shows that reviewers pressed the authors to narrow the title from “understanding personality” to predicting item correlations and to curb speculative applications.

The OSF artifact reproduces the headline numbers but not the study end to end. It contains two processed Excel files, two monolithic scripts, and two truth JSON files, with no README, requirements file, lockfile, CLI, or code for collecting the LLM outputs or running PersonalityMap. Paths remain as XXX/...; after reconstructing them and using the package versions listed in the reporting summary, the main script completes and reproduces the published tables. The additional script also completes, but sets num_bootstraps = 10 although the paper reports 10,000, produces intervals different from the supplement, and returns nan CIs for two inapplicable conditions. Both scripts print the Shapiro p-value as both W and p, and the Levene p-value as both F and p. PersonalityMap remains proprietary: two authors created it, and one also founded Positly and GuidedTrack, all disclosed conflicts; the public artifact cannot independently verify that none of the evaluated items entered its training data.

The defensible contribution is that synthetic item-correlation forecasts can be cheap and surprisingly accurate, while aggregated human expertise remains competitive with general LLMs. The proper scope is linear, cross-sectional self-report correlations from one English inventory under an artificially stratified test distribution. The evidence does not validate hiring, diagnosis, marketing, automated psychological assessment, or wholesale replacement of human data. Nor does a predicted correlation establish causation: the authors themselves state that scientific uses must ultimately be confirmed in real humans and that PersonalityMap still lacks prediction-level uncertainty estimates.

Pregunta de investigación

¿Con qué precisión predicen legos, expertos académicos, GPT-4o, Claude 3 Opus y una red especializada las correlaciones empíricas entre pares de ítems SAPA, tanto como predictores individuales como tras agregar sus respuestas por mediana?

Método

Estudio comparativo prerregistrado sobre 249 pares de 103 ítems SAPA, estratificados en tres bandas de correlación. Cada uno de 254 legos y 272 expertos valoró 30 pares asignados al azar en una escala de −1 a 1. GPT-4o y Claude 3 Opus produjeron tres predicciones por par a temperatura 0 con un prompt de 671 tokens; PersonalityMap produjo una. RQ1 compara una ejecución de cada LLM seleccionada con seed 1 contra cada individuo mediante percentiles bootstrap y win rates. RQ2 agrega por mediana dentro de cada condición y compara error absoluto, correlación predicción–verdad y acierto en tres buckets. Los análisis exploratorios añadieron SurveyBot3000 y 30 ejecuciones de GPT-4o a temperatura 1. La auditoría editorial leyó y renderizó el artículo y todos los suplementos, revisó el peer review y reporting summary, inspeccionó ambos Excel con 249 columnas de predicción, ejecutó los dos scripts con las versiones declaradas y contrastó los tests independientes con alternativas emparejadas.

Muestra: 254 legos reclutados por Positly (edad media 46,35; DE 11,83; 56% hombres; $1,80, aproximadamente $8,40/h) y 272 expertos académicos reclutados por listas y redes (edad media 33,86; DE 8,12; 52% hombres; 36% profesores, 20% con doctorado no profesores y 44% estudiantes de posgrado; tarjeta de $5 o donación). Cada persona recibió 30 pares; los legos contestaron mediana 30, mínimo 4 por persona, y cada par recibió al menos 16 respuestas. Los expertos completaron 30 por persona y cada par recibió al menos 18. Cada LLM a temperatura 0 produjo 3×249 predicciones; PersonalityMap y SurveyBot3000, 1×249; GPT-4o a temperatura 1, 30×249.

Hallazgos

  • El error absoluto medio por predictor individual fue 0,29 en legos, 0,20 en expertos, 0,14 en GPT-4o, 0,11 en Claude 3 Opus y 0,07 en PersonalityMap.
  • La ejecución seleccionada con seed 1 fue GPT2 para GPT-4o y Claude1 para Claude; el código reproduce los percentiles publicados.
  • GPT-4o alcanzó percentiles 95,67 frente a legos y 70,22 frente a expertos; Claude, 100 y 95,22; PersonalityMap, 100 frente a ambos.
  • Los win rates frente a legos/expertos fueron 90,94%/69,85% para GPT-4o, 97,64%/86,40% para Claude y 100%/99,26% para PersonalityMap, todos por encima del 50% publicado.
  • Tras agregar por mediana, los errores medios fueron 0,164 legos, 0,086 expertos, 0,140 GPT-4o, 0,104 Claude y 0,072 PersonalityMap.
  • El artículo reporta Kruskal–Wallis H(4)=90,84, p<.001 y post-hoc independientes; el código los reproduce exactamente.
  • La auditoría emparejada obtiene Friedman χ²(4)=96,59, p<.001; la jerarquía general persiste, pero GPT-4o–lego y PersonalityMap–experto cambian a p=.047, y experto–Claude queda p=.053 tras Holm.
  • Las correlaciones agregadas con la verdad fueron 0,879 legos, 0,895 expertos, 0,783 GPT-4o, 0,803 Claude y 0,908 PersonalityMap.
  • Un bootstrap emparejado de diferencias confirma que legos y expertos correlacionan más con la verdad que ambos LLM; PersonalityMap no difiere de legos ni expertos, y supera a ambos LLM en esta métrica.
  • Los aciertos por bucket fueron 196 legos, 193 expertos, 183 GPT-4o, 184 Claude y 203 PersonalityMap de 249; el χ² publicado da p=.170 y Cochran Q emparejado p=.069.
  • Treinta ejecuciones de GPT-4o a temperatura 1 elevan la correlación de la mediana a 0,88 y su error medio agregado a 0,117, pero no mejoran uniformemente percentil, win rate o buckets.
  • La fiabilidad individual ICC(2,1) fue 0,874 para GPT-4o a temperatura 0, 0,962 para Claude y 0,826 para GPT-4o a temperatura 1; al agregar k ejecuciones, ICC(2,k) fue 0,954, 0,987 y 0,993.
  • SurveyBot3000 alcanza error agregado 0,079 y correlación 0,877, pero su entrenamiento incluyó SAPA y contamina directamente este test.
  • El Excel principal contiene exactamente 254 filas legas, 272 expertas, tres GPT, tres Claude y una PersonalityMap; el adicional añade una SurveyBot3000 y treinta GPT de alta temperatura.
  • Tras reconstruir paths XXX e instalar las versiones del reporting summary, el script principal termina y reproduce tablas, figuras y conteos publicados.
  • El script adicional fija solo 10 bootstraps para los intervalos de correlación; ejecutado sin cambios produce CIs distintos a Supplementary Table 6 y no reproduce ese análisis inferencial.
  • El código denomina Dunn a pingouin.pairwise_tests con between='Condition', que devuelve Mann–Whitney U independientes y declara Paired=False.
  • El título final y las limitaciones se estrecharon durante revisión por pares para reflejar que la tarea es correlación entre ítems, no comprensión general de personalidad.

Limitaciones

  • La prueba cubre solo correlaciones lineales entre ítems de autoinforme SAPA en inglés y una medición transversal.
  • Los 249 pares se estratificaron por magnitud y signo; la distribución no representa la prevalencia natural de correlaciones entre ítems.
  • Los valores llamados verdad son estimaciones empíricas de SAPA, no parámetros sin error; el tamaño efectivo y la incertidumbre pueden variar por par.
  • Cada humano predijo 30 pares, mientras los sistemas predijeron 249; el promedio individual de error no tiene la misma precisión ni cobertura.
  • La IA recibió un prompt extenso de experto con chain-of-thought, tree-of-thought, contrargumentos, stakes emocionales y una afirmación ficticia de pago de $20; los humanos recibieron otra interfaz y pagos reales mucho menores.
  • No se incentivó la precisión de legos o expertos, limitación reconocida por los autores.
  • GPT-4o y Claude pueden haber visto SAPA durante preentrenamiento; no se dispone de datos de entrenamiento para descartarlo.
  • SurveyBot3000 sí vio SAPA, por lo que su resultado no es un test válido de generalización.
  • PersonalityMap es propietario; el depósito no permite inspeccionar pesos, datos de entrenamiento ni verificar la exclusión de los 103 ítems evaluados.
  • Dos autores crearon PersonalityMap y Spencer Greenberg fundó Positly y GuidedTrack; el conflicto está declarado, pero aumenta la importancia de validación independiente.
  • Las medianas humanas combinan al menos 16/18 y típicamente 30 o más juicios por par; los LLM a temperatura 0 solo tres y PersonalityMap uno, por lo que el presupuesto de agregación no es equivalente.
  • Kruskal–Wallis, Mann–Whitney y χ² de independencia ignoran que cada condición se evalúa sobre los mismos 249 pares; se requieren métodos emparejados o de medidas repetidas.
  • Inferir diferencias entre correlaciones por solapamiento de CIs separados no es un test directo de correlaciones dependientes que comparten la misma verdad y los mismos ítems.
  • El bootstrap de percentiles conserva fijas las distribuciones humanas y remuestrea preguntas de la IA; no propaga toda la incertidumbre de ambos lados de la comparación.
  • El código imprime los p-valores como si fueran también los estadísticos W de Shapiro y F de Levene; el reporting inferencial de supuestos es erróneo.
  • El script adicional usa 10 bootstraps pese a declarar 10.000 y no reproduce los intervalos publicados; tampoco fija un seed específico para esos intervalos.
  • No hay README, requirements, lockfile, tests, CI, entrypoint ni manifiesto que conecte outputs con tablas y figuras.
  • Los scripts contienen paths XXX, escriben múltiples derivados y figuras por efectos laterales y requieren reconstrucción manual del entorno.
  • El depósito contiene predicciones procesadas, no respuestas crudas de LLM, logs de API, costes, timestamps ni código de generación; no puede auditarse parsing o contaminación de contexto.
  • No se publican intervalos de incertidumbre por predicción de PersonalityMap ni una calibración fuera de distribución.
  • La muestra humana es de conveniencia y el benchmark procede de un contexto WEIRD; otros idiomas, culturas, formatos de ítem y fuentes de datos pueden alterar la comparación.
  • La precisión en correlaciones de autoinforme puede reflejar sesgos de método compartido, no solo relaciones psicológicas subyacentes.
  • Las aplicaciones a contratación, salud, marketing o diagnóstico se mencionan sin evaluar decisiones, personas, outcomes clínicos, fairness, seguridad o validez incremental.
  • Las correlaciones predichas no permiten inferir causalidad y el propio sistema especializado solo modela relaciones lineales.

Qué no demuestra

  • No demuestra que GPT-4o, Claude o PersonalityMap entiendan la personalidad en sentido psicológico general.
  • No valida estos sistemas como sustitutos de pruebas psicométricas administradas a personas.
  • No autoriza decisiones de contratación, diagnóstico, tratamiento, segmentación o evaluación individual.
  • No demuestra que PersonalityMap generalice a ítems, poblaciones, culturas o instrumentos fuera de SAPA.
  • No separa conocimiento psicológico, exposición previa a SAPA, calibración estadística y aprendizaje de sesgos de autoinforme como fuentes del rendimiento.
  • No establece diferencias robustas entre todas las condiciones con el análisis inferencial publicado, porque ignora el emparejamiento por ítem.
  • No ofrece una reproducción completa de la recogida de predicciones ni de los intervalos adicionales con el artefacto liberado.
  • No convierte asociaciones estimadas en mecanismos causales ni elimina la necesidad de confirmación con datos humanos reales.

Trazabilidad

Alcance: Texto completo

Versión: Communications Psychology 3, article 23; published 12 February 2025; main article 12 pages plus Supplementary Information, transparent peer review and reporting summary

Fuente consultada: https://doi.org/10.1038/s44271-025-00205-w

Revisión: Codex full-text, peer-review, spreadsheet, code and statistical robustness audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o snapshot gpt-4o-2024-05-13, temperature 0, three runs
  • Claude 3 Opus snapshot claude-3-opus-20240229, temperature 0, three runs
  • PersonalityMap proprietary deterministic deep neural network
  • GPT-4o snapshot gpt-4o-2024-05-13, temperature 1, thirty unseeded runs (additional analysis)
  • SurveyBot3000 fine-tuned all-mpnet-base-v2 model (additional contaminated comparison)

Instrumentos y métricas

  • 249 pairs from 103 SAPA Personality Inventory self-report items
  • Human correlation-estimation slider from −1 to 1 in 0.02 increments
  • Correlation primer and comprehension questions
  • Mean absolute prediction error
  • Percentile rank and item-matched win rate
  • Median aggregation by item
  • Pearson prediction–truth correlation with Fisher-z bootstrap intervals
  • Three-bin directional/magnitude classification
  • ICC(2,1) and ICC(2,k) for repeated LLM predictions

Datos utilizados

  • SAPA empirical item correlations from Condon et al. (2017)
  • OSF main processed dataset: 533 observations × 271 columns, including 249 prediction columns
  • OSF additional processed dataset: 564 observations × 271 columns
  • OSF Truth.json and EmpiricalCorUnweighted.json
  • OSF analysis scripts Code.py for main and additional conditions
  • Transparent peer-review file and Nature Portfolio reporting summary

Evidencia y localización

  • Diseño, muestra, pares SAPA, modelos, prompt y prerregistro: Main article, pp. 2–4, research questions and Methods; Supplementary Information, pp. 1–9
  • Errores, percentiles, win rates y comparaciones agregadas: Main article, pp. 4–8, Tables 1–5 and Figures 1–5
  • GPT-4o a temperatura 1, SurveyBot3000 e ICC: Main article, pp. 7–8; Supplementary Information, pp. 9–14, Tables 2–6
  • Limitaciones, aplicaciones, conflictos y disponibilidad: Main article, pp. 8–12, Discussion, Limitations, Practical implications, Competing interests and Data/Code availability
  • Cambios solicitados por revisores y estrechamiento del título y las afirmaciones: Transparent peer review, Version 0 reviewer reports and Version 1 decision letter/rebuttal
  • Estructura de los Excel y reproducción del script principal: OSF osf.io/kzgy7, Data and Code/Data.xlsx plus Code.py, audited and executed 15 Jul 2026
  • Bootstrap de 10, CIs no reproducidos y tests independientes mal etiquetados: OSF additional Code.py lines 578–657 and 764–792; Full Data Processed.xlsx; executed 15 Jul 2026
  • Robustez con pruebas emparejadas: Editorial reanalysis of the released 249 paired item predictions, Friedman/Wilcoxon-Holm, Cochran Q/McNemar and paired bootstrap, 15 Jul 2026