On the emergent capabilities of ChatGPT 4 to estimate personality traits

Evaluación y validez psicométrica2025Frontiers (Artificial Intelligence)Revisión editorial aprobada

Autores: Marco Piastra, Patrizia Catellani

Palabras clave: Artificial Intelligence, Personality Traits, Large Language Models, Big Five, Text Analysis, ChatGPT 4

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
9
Hallazgos
15
Limitaciones
14
Evidencias

Resumen editorial

Español

Este informe breve evalúa si GPT-4o puede estimar los cinco grandes rasgos a partir de textos sin ejemplos puntuados y si la confianza que declara sirve para detectar estimaciones fiables. Los autores comparan las salidas del modelo con autoinformes en 2.347 ensayos de estudiantes de Psicología y en mensajes de Twitter de 294 participantes de PAN15. En los ensayos, las correlaciones de la configuración base fueron modestas y bastante homogéneas (r = 0,239–0,283); en PAN15 fueron menores y heterogéneas (r = −0,042–0,259), incluida una asociación negativa para apertura. A la vez, aparecen sesgos de nivel que una correlación no captura: por ejemplo, neuroticismo pasa de una media de autoinforme de −0,011 a 0,375 en los ensayos, y apertura de 0,253 a 0,375 en PAN15. Añadir descripciones de facetas o pedir confianza apenas cambia el cuadro. La confianza autodeclarada permanece alta, se relaciona con la magnitud de las predicciones y no con su error; tampoco cae de forma suficiente cuando se reduce drásticamente el texto. El trabajo aporta una prueba comparativa útil y código suplementario, pero no valida una evaluación individual: el criterio es autoinforme, no hay comparador humano o computacional aplicado a los mismos casos, faltan intervalos o pruebas inferenciales en los resultados principales y el material reproducible discrepa del artículo en algunos parámetros.

English

This brief report tests whether GPT-4o can estimate Big Five traits from text without scored examples and whether its stated confidence identifies reliable estimates. The authors compare model outputs with self-reports for 2,347 psychology-student essays and Twitter messages from 294 PAN15 participants. On the essays, baseline correlations are modest and fairly even (r = .239–.283); on PAN15 they are weaker and heterogeneous (r = −.042–.259), including a negative association for Openness. Correlation also hides substantial level bias: for example, mean Neuroticism shifts from −.011 in self-report to .375 in the essay predictions, and PAN15 Openness from .253 to .375. Adding facet descriptions or asking for confidence changes little. Stated confidence remains high, tracks the magnitude of predictions rather than their error, and does not fall enough when the available text is sharply reduced. The study supplies a useful comparison and supplementary code, but it does not validate individual assessment: the criterion is self-report, no human or computational comparator is run on the same cases, the main results lack uncertainty intervals or reported inferential tests, and the released configuration differs from the paper on some parameters.

Pregunta de investigación

¿Con qué grado de acuerdo puede GPT-4o estimar en zero-shot los cinco grandes rasgos de personalidad a partir de dos tipos de texto, en comparación con el autoinforme, y hasta qué punto la confianza numérica que el propio modelo declara refleja la exactitud de esas estimaciones o la suficiencia del texto?

Método

Se reutilizan dos conjuntos en inglés. El corpus Essays parte de 2.467 estudiantes que escribieron durante 20 minutos en estilo de flujo de conciencia; tras retirar registros incompletos quedan 2.347. Sus puntuaciones, procedentes de cuestionarios y esquemas de cálculo parcialmente distintos entre 1997 y 2004, se convierten a medias por ítem, se normalizan a [−0,5, 0,5] y se redondean a décimas. PAN15 reúne 294 autores y entre 26 y 100 tuits por persona (81% con 100); su BFI-10 recibe la misma normalización y redondeo. Mediante la API Batch se consulta gpt-4o-2024-05-13 con temperatura 0 y semilla 123, solicitando JSON con cinco puntuaciones en una escala de once valores. Se comparan un prompt base, ampliaciones psicométricas y versiones que piden confianza 0–1; el artículo informa sobre todo la base y una descripción de facetas. Cada experimento se ejecuta cuatro veces y se promedian las salidas. Se calculan correlaciones de Pearson y 1 − NRMSE, se filtran predicciones por umbral de confianza y se reduce progresivamente el número de tuits para estudiar suficiencia del texto.

Muestra: 2.347 ensayos completos de estudiantes de Psicología, procedentes de una muestra original de 2.467 y recogidos entre 1997 y 2004 salvo 2001; y mensajes de Twitter de 294 participantes de PAN15, con 26–100 mensajes por autor y exactamente 100 en el 81% de los casos.

Hallazgos

  • En Essays, el prompt base alcanza correlaciones r = 0,276 en extraversión, 0,283 en neuroticismo, 0,239 en amabilidad, 0,261 en responsabilidad y 0,269 en apertura; equivalen aproximadamente a un 5,7–8,0% de varianza compartida por rasgo, no a una predicción individual fuerte.
  • En PAN15, las correlaciones base son 0,130, 0,259, 0,087, 0,196 y −0,042 respectivamente. La descripción de facetas mejora amabilidad y responsabilidad hasta 0,159 y 0,264, pero apertura sigue siendo negativa (−0,025).
  • Las predicciones están comprimidas y sesgadas hacia determinadas bandas de la escala. El caso más claro es Essays-neuroticismo: media de autoinforme −0,011 frente a 0,375 del modelo base, con una desviación típica del modelo de solo 0,11 frente a 0,20.
  • En PAN15 el modelo base sobreestima especialmente extraversión (0,321 frente a 0,170) y apertura (0,375 frente a 0,253); en apertura, un 1 − NRMSE de 0,759 convive con correlación negativa, mostrando que proximidad media y ordenación entre personas responden a propiedades distintas.
  • Pedir confianza altera ligeramente las puntuaciones, pero no las vuelve sistemáticamente mejores. En Essays, las correlaciones con confianza oscilan entre 0,244 y 0,287; en PAN15 entre −0,030 y 0,273.
  • La confianza media declarada es alta incluso en rasgos con muy poca señal: en PAN15 alcanza 0,797 para extraversión y 0,793 para apertura, aunque sus correlaciones base con confianza son 0,104 y −0,030.
  • Al conservar solo estimaciones que superan umbrales de confianza, 1 − NRMSE no mejora y generalmente empeora; además, la confianza crece con puntuaciones predichas más altas, lo que indica una dependencia del nivel estimado y no calibración frente al error.
  • Cuando PAN15 se recorta desde todos los mensajes hasta los dos primeros tuits, las correlaciones tienden hacia cero, mientras la confianza permanece aproximadamente entre 0,56 y 0,67 según rasgo incluso con dos mensajes.
  • Los cuatro resultados por condición se promedian para amortiguar la no determinación residual, pero el artículo no muestra la variación entre ejecuciones.

Limitaciones

  • El patrón no es robusto entre dominios: el rendimiento de los ensayos no se replica en PAN15 y apertura llega a correlacionar negativamente con el autoinforme.
  • Las asociaciones de Essays son pequeñas en términos de varianza explicada. El texto las denomina significativas, pero la tabla principal no aporta p-valores, intervalos de confianza ni corrección por las numerosas comparaciones.
  • El autoinforme es un criterio imperfecto para una inferencia observacional. No se evalúan jueces humanos ni otros modelos sobre exactamente los mismos textos, de modo que la comparación con metaanálisis previos es indirecta.
  • El corpus Essays combina años, cuestionarios y procedimientos de puntuación parcialmente distintos; la conversión a medias por ítem, normalización y redondeo no elimina la falta de equivalencia de medida.
  • Tanto las etiquetas como las respuestas del modelo se cuantizan a pasos de 0,1 en un rango estrecho. Esta discretización condiciona las correlaciones, el RMSE y los histogramas.
  • 1 − NRMSE puede parecer alto cuando las predicciones se concentran cerca de una media frecuente, incluso si no ordenan correctamente a las personas; PAN15-apertura ofrece el ejemplo más claro.
  • La confianza solicitada es una declaración textual del modelo, no una probabilidad calibrada. No se presentan curvas de calibración, error esperado de calibración, puntuación de Brier, intervalos predictivos ni cobertura.
  • El análisis de confianza por umbrales cambia el número de observaciones y promedia cuatro ejecuciones, lo que produce recuentos fraccionarios en la figura; no se muestran dispersiones ni pruebas que cuantifiquen la incertidumbre de esas curvas.
  • Solo se estudia una instantánea de un modelo, una temperatura y una semilla. El rendimiento no puede extrapolarse a otros modelos, versiones, idiomas o configuraciones.
  • Hay una discrepancia reproducible: el artículo declara gpt-4o-2024-05-13 y semilla 123, mientras chatgpt_config.py del suplemento configura el alias gpt-4o y semilla 1234. El repositorio tampoco incluye el fichero Essays ya preprocesado sin permiso adicional.
  • El término zero-shot significa que no se dan ejemplos puntuados, pero el prompt identifica explícitamente el Big Five, adopta el rol de psicólogo social y, en algunas condiciones, incorpora descripciones de facetas; no es una inferencia libre de conocimiento inducido por el prompt.
  • Los dominios son estrechos y antiguos: ensayos de estudiantes de Psicología y Twitter en inglés. No se analiza generalización temporal, cultural, lingüística o a textos conversacionales y clínicos.
  • No se informan resultados por edad, género u otros grupos, ni se estudian sesgos o diferencias de error entre subpoblaciones.
  • El diseño es predictivo y transversal; no permite atribuir los resultados a rasgos latentes estables ni distinguir personalidad de tema, estilo, estado, cohorte o contexto de plataforma.
  • Aunque se reutilizan conjuntos existentes y el artículo declara que no requirió nueva aprobación ética, no se evalúan en este trabajo los riesgos de privacidad, consentimiento contextual o uso secundario al desplegar inferencia de personalidad sobre textos reales.

Qué no demuestra

  • No demuestra que GPT-4o pueda evaluar con fiabilidad la personalidad de una persona concreta.
  • No demuestra que la confianza declarada por el modelo esté calibrada ni que detecte texto insuficiente.
  • No demuestra superioridad o equivalencia frente a jueces humanos, modelos supervisados u otros LLM en los mismos datos.
  • No demuestra que las correlaciones sean estables entre dominios, idiomas, poblaciones o versiones del modelo.
  • No valida decisiones clínicas, laborales, educativas, forenses ni de selección basadas en estas puntuaciones.
  • No permite interpretar las salidas como medidas causales o directas de rasgos latentes, independientes del contenido y del contexto del texto.

Modelos evaluados

  • GPT-4o (gpt-4o-2024-05-13)

Instrumentos y métricas

  • Big Five Inventory-10 (BFI-10)
  • Big Five self-report measures in the Essays corpus (heterogeneous by collection year)
  • Pearson correlation
  • 1 − normalized root mean square error (1 − NRMSE)
  • Model-stated confidence score (0–1)

Datos utilizados

  • Essays / stream-of-consciousness corpus (Pennebaker and King, 1999)
  • PAN 2015 Author Profiling English dataset

Evidencia y localización

  • Preguntas de investigación y alcance zero-shot: Publisher PDF, pp. 1–2, abstract and sections 1–2
  • Composición, armonización y redondeo de Essays: Publisher PDF, pp. 2–3, section 2.1.1
  • Composición y BFI-10 de PAN15: Publisher PDF, pp. 2–3, section 2.1.2
  • Prompts, escala, confianza y descripciones adicionales: Publisher PDF, pp. 3–4, section 2.2
  • Modelo, API, temperatura, semilla y cuatro ejecuciones: Publisher PDF, p. 4, section 2.3
  • Correlaciones, medias, desviaciones y 1 − NRMSE completos: Publisher PDF, pp. 4–5, section 3 and Table 1
  • Compresión y sesgo de las distribuciones: Publisher PDF, pp. 5–6, Figure 1 and accompanying text
  • Confianza asociada a puntuaciones pero no a exactitud: Publisher PDF, p. 6, Figure 2 and accompanying text
  • Reducción del número de tuits y persistencia de confianza: Publisher PDF, pp. 6–7, Figure 3 and accompanying text
  • Comparación indirecta, criterio de autoinforme y limitaciones reconocidas: Publisher PDF, p. 7, section 4
  • Acceso a datos y material suplementario: Publisher PDF, pp. 7–8, data availability and supplementary material statements
  • Implementación de correlación, 1 − RMSE y filtrado por confianza: Supplementary Data Sheet 1, chatgpt_utils.py, compute_statistics and correlation
  • Discrepancia de modelo y semilla respecto al artículo: Supplementary Data Sheet 1, chatgpt_config.py, model and request_input_template
  • Restricción de acceso al Essays preprocesado: Supplementary Data Sheet 1, README, section 0.1