Este informe breve evalúa si GPT-4o puede estimar los cinco grandes rasgos a partir de textos sin ejemplos puntuados y si la confianza que declara sirve para detectar estimaciones fiables. Los autores comparan las salidas del modelo con autoinformes en 2.347 ensayos de estudiantes de Psicología y en mensajes de Twitter de 294 participantes de PAN15. En los ensayos, las correlaciones de la configuración base fueron modestas y bastante homogéneas (r = 0,239–0,283); en PAN15 fueron menores y heterogéneas (r = −0,042–0,259), incluida una asociación negativa para apertura. A la vez, aparecen sesgos de nivel que una correlación no captura: por ejemplo, neuroticismo pasa de una media de autoinforme de −0,011 a 0,375 en los ensayos, y apertura de 0,253 a 0,375 en PAN15. Añadir descripciones de facetas o pedir confianza apenas cambia el cuadro. La confianza autodeclarada permanece alta, se relaciona con la magnitud de las predicciones y no con su error; tampoco cae de forma suficiente cuando se reduce drásticamente el texto. El trabajo aporta una prueba comparativa útil y código suplementario, pero no valida una evaluación individual: el criterio es autoinforme, no hay comparador humano o computacional aplicado a los mismos casos, faltan intervalos o pruebas inferenciales en los resultados principales y el material reproducible discrepa del artículo en algunos parámetros.
Pregunta de investigación
¿Con qué grado de acuerdo puede GPT-4o estimar en zero-shot los cinco grandes rasgos de personalidad a partir de dos tipos de texto, en comparación con el autoinforme, y hasta qué punto la confianza numérica que el propio modelo declara refleja la exactitud de esas estimaciones o la suficiencia del texto?