Schoenegger y coautores estudian una tarea estrecha pero útil: estimar la correlación empírica entre dos ítems de personalidad sin recoger nuevas respuestas al cuestionario. El conjunto contiene 249 pares de 103 ítems de SAPA. No es una muestra natural de correlaciones: se construyó con un tercio por debajo de −0,2, un tercio entre −0,2 y 0,2 y un tercio por encima de 0,2. Comparan 254 personas no expertas, 272 académicos de psicología o ciencias del comportamiento, tres ejecuciones de GPT-4o a temperatura 0, tres de Claude 3 Opus, y una predicción determinista de PersonalityMap, una red propietaria entrenada específicamente con pares de ítems. Cada persona contestó 30 pares asignados al azar, salvo algunos legos incompletos, mientras cada sistema cubrió los 249.
En las comparaciones individuales, una ejecución seleccionada con seed fijo de GPT-4o tuvo error absoluto medio 0,14, Claude 0,11 y PersonalityMap 0,07, frente a medias por participante de 0,29 en legos y 0,20 en expertos. GPT-4o quedó en el percentil 95,67 frente a legos y 70,22 frente a expertos; Claude, en 100 y 95,22; PersonalityMap, en 100 frente a ambos. Los win rates, calculados sobre los pares realmente contestados por cada persona, fueron 90,94%/69,85% para GPT-4o, 97,64%/86,40% para Claude y 100%/99,26% para PersonalityMap frente a legos/expertos. Esto respalda que una consulta de estos sistemas suele ser más precisa que un individuo en esta tarea. No prueba una comprensión general de la personalidad: predice parámetros de ítems conocidos y la comparación individual da a la IA 249 pares, pero a cada humano solo 30.
Cuando se agrega por ítem mediante la mediana, la ventaja cambia. El error medio fue 0,164 para legos, 0,086 para expertos, 0,140 para GPT-4o, 0,104 para Claude y 0,072 para PersonalityMap. Las correlaciones entre predicción y valor empírico fueron 0,88, 0,90, 0,78, 0,80 y 0,91, respectivamente. El test de buckets (<−0,1, −0,1 a 0,1, >0,1) no encontró diferencias, χ²(4)=6,42, p=.170. Sin embargo, las pruebas publicadas de error tratan como independientes cinco medidas sobre los mismos 249 pares: usan Kruskal–Wallis y llaman “Dunn” a comparaciones Mann–Whitney con Paired=False. Una comprobación editorial emparejada produce Friedman χ²(4)=96,59, p<.001 y Wilcoxon-Holm: confirma la superioridad general de PersonalityMap y Claude sobre GPT-4o, pero cambia dos conclusiones límite, GPT-4o frente a legos pasa a p=.047 y PersonalityMap frente a expertos a p=.047, mientras expertos frente a Claude queda en p=.053. Para los buckets, el Cochran Q emparejado sigue sin ser significativo, Q(4)=8,70, p=.069. Estas comprobaciones no sustituyen una revisión estadística formal, pero muestran que parte del detalle inferencial depende de haber ignorado el emparejamiento.
Los análisis añadidos tras la primera revisión por pares prueban 30 consultas no sembradas de GPT-4o a temperatura 1 y SurveyBot3000. La mediana de las 30 consultas mejora la correlación agregada de GPT-4o hasta 0,88, sin mejorar de forma uniforme las otras métricas. SurveyBot3000 parece competitivo, pero fue entrenado con SAPA y por tanto con el propio conjunto usado como test; los autores reconocen que no permite distinguir generalización de memorización. La lectura del peer review transparente confirma que el título se estrechó de “entender personalidad” a “predecir correlaciones entre ítems” y que los revisores pidieron reducir las aplicaciones especulativas.
El artefacto OSF permite reproducir las cifras principales, pero no es una reproducción de extremo a extremo. Incluye dos Excel procesados, dos scripts monolíticos y dos JSON de verdad, sin README, requirements, lockfile, CLI ni código para recopilar respuestas de los LLM o ejecutar PersonalityMap. Los paths son XXX/...; tras reconstruirlos y usar las versiones declaradas en el reporting summary, el script principal termina y reproduce las tablas. El script adicional también termina, pero fija num_bootstraps = 10 aunque el artículo declara 10.000, genera intervalos distintos de los publicados y produce CIs nan para dos condiciones improcedentes. Ambos scripts imprimen el p-valor como si fuera también el estadístico W de Shapiro o F de Levene. PersonalityMap sigue siendo propietario: dos autores lo crearon y uno fundó además Positly y GuidedTrack, un conflicto declarado; la afirmación de que ningún ítem de test entró en su entrenamiento no puede comprobarse con el depósito.
La contribución defendible es demostrar que los pronósticos sintéticos de correlaciones pueden ser baratos y sorprendentemente precisos, y que agregar expertos humanos sigue siendo competitivo con LLM generales. El alcance correcto es la predicción de correlaciones lineales, transversales y de autoinforme en un inventario inglés y una distribución de test artificialmente estratificada. No valida selección de personal, diagnóstico, marketing, evaluación psicológica automatizada ni sustitución de datos humanos. Tampoco convierte una correlación predicha en evidencia causal: los propios autores señalan que cualquier uso científico debe confirmarse finalmente con personas reales y que faltan estimaciones de incertidumbre para PersonalityMap.