Mind Reading or Misreading? LLMs on the Big Five Personality Test

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Francesco Di Cursi, Chiara Boldrini, Marco Conti, Andrea Passarella

Palabras clave: Large Language Models, Personality, Big Five, Bias, Persona

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
22
Hallazgos
47
Limitaciones
11
Evidencias

Resumen editorial

Español

Este preprint evalúa predicción automática binaria de los cinco rasgos Big Five desde texto mediante GPT-4 y cuatro modelos locales, Phi-3, Gemma 7B, Llama 3.1 8B y Mistral 7B, sobre Essays, MyPersonality y Pandora. Realiza 135 configuraciones: 75 con prompt simple para los cinco modelos y 60 con prompt enriquecido solo para los cuatro modelos abiertos. Cada modelo clasifica por separado cada rasgo con 0 o 1; temperatura 0 y 20 tokens máximos. El prompt enriquecido incorpora definiciones de Costa y McCrae, frases IPIP positivas y negativas y largas listas de adjetivos de Goldberg. Se reportan accuracy, macro-F1 y precision, recall y F1 por clase, además de salidas inválidas. El hallazgo más útil es diagnóstico, no de rendimiento. Solo 13 de 135 configuraciones, 9,6%, alcanzan F1 de al menos 0,5 en ambas clases. La mejor fila equilibrada es Mistral con Agreeableness en MyPersonality y prompt complejo: accuracy 0,608, F1 negativa 0,600, F1 positiva 0,620 y macro-F1 0,610, apenas 7,2 puntos de accuracy sobre la clase mayoritaria. GPT-4 con Agreeableness en Essays obtiene 0,593 de accuracy y macro-F1 0,585; Mistral con Openness en Essays, 0,584 y 0,575. Muchos resultados con accuracy aparentemente aceptable predicen casi siempre la clase positiva. Los prompts enriquecidos suelen eliminar fallos de formato y aumentar recall positivo, pero a menudo reducen recall negativo; no mejoran de forma uniforme accuracy o equilibrio. Extraversion y Neuroticism son las dimensiones más débiles en estas condiciones. La interpretación requiere cautela adicional. Las salidas inválidas se eliminan antes de calcular métricas, por lo que el rendimiento es condicional a que el modelo obedezca. Phi-3 pierde aproximadamente 80–85% de Essays con el prompt simple; sus métricas restantes describen una submuestra muy seleccionada. El corte F1 ≥ 0,5 se denomina repetidamente umbral de significación aunque no hay test, distribución nula, intervalo o corrección múltiple, y los propios autores admiten que 0,5 no equivale a azar bajo desbalance. GPT-4 usa un prompt distinto, solo se prueba en la condición simple y no se identifica su snapshot; afirmar que modelos abiertos con prompt complejo lo igualan mezcla modelo y prompt. Además, GPT-4 recibe la regla 1 para rasgo alto o moderado, mientras los otros reciben presencia o expresión del rasgo. Los Big Five son continuos, no propiedades presentes o ausentes, y las etiquetas de autor no garantizan que un texto concreto exprese el rasgo. Pandora añade otra transformación no validada: sus scores 1–100 se interpolan a 1–5 y se cortan con el mayor valor de MyPersonality aún etiquetado 0; no se publican los cinco umbrales. Sus 14.221 textos proceden de 1.608 usuarios, pero las métricas tratan textos como unidades sin incertidumbre agrupada por autor. Hay también inconsistencias internas. En GPT-4/Openness/Pandora, Tabla 2 reporta 679 inválidos, mientras la diagonal de Tabla 3 y los soportes 7.532+6.209 de Tabla 4 implican exactamente 480; una unión de inválidos no puede ser menor que los 679 de un rasgo. MyPersonality declara 255 textos, pero las clases de cada rasgo suman 250 sin explicar cinco etiquetas ausentes. Tabla 1 rotula mediana y SD, aunque el texto dice media y SD. No se localizaron código, predicciones, etiquetas procesadas o logs. Las tags Ollama son mutables y carecen de digest, fecha, cuantización y versión; GPT-4 carece de snapshot y fecha. Por tanto, la conclusión defendible es que, en estos prompts y datasets, la clasificación zero-shot suele ser débil o asimétrica y el enriquecimiento cambia cumplimiento y sesgo de clase. El trabajo aporta una buena advertencia sobre métricas por clase y abstenciones, pero no demuestra predicción fiable, significación estadística, paridad controlada con GPT-4 ni validez para perfilar personas.

English

This preprint evaluates binary automatic prediction of the five Big Five traits from text with GPT-4 and four local models, Phi-3, Gemma 7B, Llama 3.1 8B, and Mistral 7B, on Essays, MyPersonality, and Pandora. It runs 135 configurations: 75 with a simple prompt across all five models and 60 with an enriched prompt for the four open models only. Each model classifies each trait separately as 0 or 1 at temperature 0 and a 20-token maximum. The enriched prompt supplies Costa and McCrae definitions, positive and negative IPIP phrases, and long Goldberg adjective lists. The paper reports accuracy, macro-F1, and class-specific precision, recall, and F1, together with invalid outputs. The most useful result is diagnostic rather than strong performance. Only 13 of 135 configurations, 9.6%, reach F1 of at least 0.5 for both classes. The strongest balanced row is Mistral on Agreeableness in MyPersonality with the complex prompt: accuracy 0.608, negative-class F1 0.600, positive-class F1 0.620, and macro-F1 0.610, only 7.2 accuracy points above the majority class. GPT-4 on Agreeableness in Essays reaches accuracy 0.593 and macro-F1 0.585; Mistral on Openness in Essays reaches 0.584 and 0.575. Many rows with superficially acceptable accuracy predict the positive class almost exclusively. Enriched prompts usually remove formatting failures and raise positive recall, but often reduce negative recall; they do not uniformly improve accuracy or balance. Extraversion and Neuroticism are the weakest dimensions under these conditions. Interpretation needs additional caution. Invalid outputs are discarded before metrics are calculated, so performance is conditional on model compliance. Phi-3 loses roughly 80–85% of Essays under the simple prompt; its remaining metrics describe a highly selected subset. The F1 ≥ 0.5 cutoff is repeatedly called a significance threshold even though there is no test, null distribution, interval, or multiplicity correction, and the authors acknowledge that 0.5 is not a chance threshold under imbalance. GPT-4 receives a different prompt, is tested only in the simple condition, and has no identified snapshot; claims that complex-prompt open models match it confound model and prompt. GPT-4 is also told that 1 means high or moderate trait level, while the other models classify trait presence or expression. Big Five dimensions are continuous rather than present-or-absent properties, and author-level labels do not guarantee that one text expresses a trait. Pandora adds an unvalidated transformation: its 1–100 scores are interpolated to 1–5 and thresholded using the highest MyPersonality score still labeled 0; the five thresholds are not released. Its 14,221 texts come from 1,608 users, but metrics treat texts as units without author-clustered uncertainty. Internal inconsistencies also matter. For GPT-4/Openness/Pandora, Table 2 reports 679 invalids, while the Table 3 diagonal and Table 4 supports of 7,532+6,209 imply exactly 480; an invalid union cannot be smaller than 679 invalids for one trait. MyPersonality reports 255 texts, but each trait's classes total 250 without explaining five missing labels. Table 1 labels median and SD while the prose says mean and SD. No code, predictions, processed labels, or logs were located. Ollama tags are mutable and lack digests, dates, quantization, and runtime version; GPT-4 lacks a snapshot and date. The defensible conclusion is therefore that zero-shot classification is usually weak or asymmetric in these prompts and datasets, and prompt enrichment changes compliance and class bias. The paper usefully warns about class-specific metrics and abstentions, but it does not establish reliable prediction, statistical significance, a controlled parity comparison with GPT-4, or validity for profiling people.

Pregunta de investigación

¿Con qué fiabilidad cinco LLM clasifican presencia o ausencia binaria de rasgos Big Five a partir de textos de tres dominios, y cómo cambia su cumplimiento, equilibrio por clase y rendimiento al enriquecer el prompt con descriptores psicológicos?

Método

Evaluación zero-shot sobre cinco rasgos y tres datasets. GPT-4, phi3:latest, gemma:7b-instruct, llama3.1:8b y mistral:instruct reciben prompts simples; los cuatro modelos Ollama reciben además prompts complejos con definiciones, frases IPIP y adjetivos. Se generan etiquetas 0/1 a temperatura 0 y máximo 20 tokens. Se aceptan respuestas de un dígito o que empiecen por 0/1; las demás se descartan. Se calculan 135 informes de clasificación con accuracy, macro-F1 y métricas por clase. Pandora se reescala y binariza con umbrales transferidos desde MyPersonality.

Muestra: Se evalúan 2.467 Essays, 255 textos agregados de MyPersonality y 14.221 posts de Pandora. Las clases MyPersonality suman 250 por rasgo, no 255. Pandora contiene múltiples textos por 1.608 usuarios y presenta fuerte desbalance: salvo Openness, las clases positivas son minoritarias. Cada combinación modelo-dataset-rasgo-prompt es un experimento; hay 135, pero se excluyen respuestas inválidas antes de medir y no se modela dependencia por usuario.

Hallazgos

  • La fuente vigente es arXiv:2511.23101v1, enviada el 28 de noviembre de 2025, con 28 páginas.
  • Las 28 páginas se renderizaron e inspeccionaron visualmente.
  • El PDF vigente coincide byte a byte con la caché y tiene SHA-256 04dc74be5893c53bc5c743c22984bd9f9c01187d15bc8aed3645a50b03c08acd.
  • Se realizan 75 experimentos con prompt simple y 60 con prompt complejo, 135 en total.
  • Solo 13 configuraciones alcanzan F1 mayor o igual que 0,5 en ambas clases: 6 simples y 7 complejas.
  • La tasa de paso de ese corte es 9,6% total, 8,0% simple y 11,7% compleja.
  • La mejor fila equilibrada es Mistral/Agreeableness/MyPersonality/complejo con accuracy 0,608 y macro-F1 0,610.
  • Esa accuracy mejora 0,072 sobre la clase mayoritaria de la misma muestra.
  • GPT-4/Agreeableness/Essays obtiene accuracy 0,593 y macro-F1 0,585 con su prompt propio.
  • Mistral/Openness/Essays obtiene accuracy 0,584 y macro-F1 0,575.
  • Openness y Agreeableness concentran la mayor parte de las configuraciones que superan el corte por ambas clases.
  • Extraversion y Neuroticism presentan los resultados más débiles y sesgados.
  • Los prompts complejos suelen elevar recall de la clase 1 y reducir recall de la clase 0.
  • Los prompts complejos eliminan muchas salidas inválidas, especialmente en Phi-3 sobre Essays.
  • Phi-3 produce entre 80,18% y 84,84% de inválidos en Essays con prompt simple.
  • Llama 3.1 produce más inválidos en Pandora con el prompt complejo que con el simple.
  • Las salidas inválidas se descartan antes de accuracy y F1.
  • Tabla 2 reporta 679 inválidos para GPT-4/Pandora en cada rasgo.
  • Tabla 3 reporta 480 textos inválidos únicos para GPT-4/Pandora y Tabla 4 también implica 480 en Openness.
  • Las cifras 679 y 480 son incompatibles para la misma condición.
  • MyPersonality declara 255 textos pero cada par de clases suma 250.
  • No se localizaron código, predicciones crudas, etiquetas Pandora procesadas o logs de ejecución.

Limitaciones

  • Los Big Five son dimensiones continuas; presencia o ausencia binaria simplifica y reifica el constructo.
  • Una etiqueta alta o baja del autor no implica que cada texto exprese el rasgo.
  • El prompt de GPT-4 define 1 como nivel alto o moderado, distinto de presencia o expresión en los otros prompts.
  • GPT-4 usa un prompt distinto y no recibe la condición compleja.
  • Comparar modelos abiertos complejos con GPT-4 simple confunde arquitectura y prompt.
  • No se identifica el snapshot de GPT-4 ni la fecha de las llamadas.
  • La estimación de un billón de parámetros para GPT-4 no procede de una especificación oficial del modelo.
  • Las tags Ollama latest e instruct son mutables y no garantizan el mismo artefacto en una réplica.
  • No se reportan hashes, cuantización, plantillas de chat, versión Ollama o revisiones de modelos.
  • Temperatura 0 no garantiza determinismo entre runtimes, hardware o backends.
  • No se reportan seed, top-p, stop tokens o todos los parámetros de generación.
  • Aceptar cualquier salida que empiece por 0 o 1 puede clasificar como válida una explicación ambigua o contradictoria.
  • No se publica el parser, por lo que no puede verificarse el tratamiento exacto de espacios, signos o texto posterior.
  • Eliminar inválidos condiciona las métricas al cumplimiento y puede favorecer modelos que se abstienen selectivamente.
  • No se informa rendimiento end-to-end penalizando inválidos como errores o abstenciones.
  • Con 80–85% de inválidos, los resultados Phi-3/Essays simple se basan en una fracción no representativa.
  • La inspección manual de fallos no indica tamaño de submuestra, revisores, criterio o acuerdo.
  • Los modelos descartados por formatos inválidos se seleccionan después de una criba no documentada por completo.
  • El corte 0,5 es heurístico y no una prueba de significación.
  • El paper reconoce que 0,5 no equivale al azar bajo desbalance.
  • No hay intervalos de confianza, bootstrap, tests pareados, corrección múltiple o tamaño de efecto.
  • Se inspeccionan 135 configuraciones y se destacan las mejores sin controlar selección múltiple.
  • La mejor macro-F1 es 0,61 y no justifica por sí sola calificar el sistema como fiable.
  • No se comparan curvas ROC o precision-recall, calibración, Brier score o umbrales probabilísticos.
  • Las predicciones 0/1 no permiten calibrar confianza ni ajustar costes de errores.
  • Transferir umbrales de MyPersonality a Pandora supone comparabilidad entre instrumentos y distribuciones no demostrada.
  • No se publican los umbrales exactos usados para cada rasgo de Pandora.
  • La frase maximiza contraste no se formaliza como objetivo reproducible ni se valida externamente.
  • Pandora queda fuertemente desbalanceado por la binarización elegida.
  • Pandora tiene 14.221 textos de 1.608 usuarios; tratarlos como unidades puede inflar precisión aparente.
  • No se usa bootstrap por usuario, errores agrupados o agregación por autor.
  • MyPersonality muestra cinco etiquetas menos por rasgo que textos declarados sin explicación.
  • Las tasas de inválidos MyPersonality usan 255 como denominador aunque los soportes etiquetados son 250.
  • La inconsistencia 679 frente a 480 impide saber el denominador correcto de GPT-4/Openness/Pandora.
  • Tabla 1 no aclara si la tendencia central de longitudes es media o mediana.
  • Las listas del prompt complejo mezclan descriptores de rasgo con términos moralmente cargados y socialmente deseables.
  • El mayor recall positivo puede ser una consecuencia directa de esa polaridad, no mejor inferencia psicológica.
  • No hay ablación separada de definición, frases IPIP y adjetivos.
  • No se prueban prompts neutrales, calibrados, contrabalanceados o con orden alternativo.
  • No se mide sensibilidad a redacción, orden de listas o longitud de texto.
  • Los tres datasets difieren en idioma pragmático, longitud, plataforma y proceso de etiqueta.
  • Los benchmarks SOTA citados usan preprocesado, particiones, modelos supervisados y métricas diferentes.
  • No hay evaluación en una partición común que sostenga paridad con sistemas previos.
  • No se publican predicciones, matrices de confusión completas de las 135 condiciones o scripts.
  • No se discute una licencia o vía de acceso reproducible para la versión exacta de MyPersonality usada.
  • La tarea implica perfilado sensible; aunque el paper advierte de riesgos, no evalúa disparidades demográficas o daño.
  • El estudio es un preprint sin evidencia de revisión por pares en la fuente comprobada.

Qué no demuestra

  • No establece predicción fiable de personalidad desde texto.
  • No demuestra significación estadística con el corte F1 0,5.
  • No demuestra que 0 y 1 correspondan a ausencia y presencia reales de un rasgo.
  • No valida los umbrales transferidos de MyPersonality a Pandora.
  • No demuestra que el prompt complejo mejore rendimiento equilibrado de forma general.
  • No ofrece una comparación controlada entre GPT-4 y los modelos abiertos.
  • No demuestra paridad con benchmarks supervisados bajo el mismo protocolo.
  • No demuestra independencia de las observaciones Pandora.
  • No demuestra que la salida inválida sea aleatoria respecto a clase o dificultad.
  • No permite resolver la inconsistencia 679 frente a 480 sin datos crudos.
  • No permite reproducir modelos mutables y GPT-4 no versionado.
  • No justifica uso en selección laboral, salud, publicidad, justicia u otros contextos sensibles.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2511.23101v1, submitted 28 November 2025, 28 pages

Fuente consultada: https://arxiv.org/abs/2511.23101

Revisión: Codex complete bilingual full-text fidelity pass, current arXiv-version reconciliation, all-page PDF visual inspection, model and dataset reproducibility audit, invalid-output denominator audit, class-wise table reconciliation, majority-baseline reconstruction, prompt-comparability and construct-validity assessment; summaries written from the full paper and reported tables rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4 through the OpenAI API; exact snapshot, run date and generation configuration beyond the prompt are not reported
  • phi3:latest via Ollama, described as approximately 3.8B; mutable tag without digest or quantization
  • gemma:7b-instruct via Ollama; mutable tag without digest or quantization
  • llama3.1:8b via Ollama; mutable tag without digest or quantization
  • mistral:instruct via Ollama, described as 7B; mutable tag without digest or quantization

Instrumentos y métricas

  • Binary Big Five/OCEAN labels for Openness, Conscientiousness, Extraversion, Agreeableness and Neuroticism
  • Simple open-model prompt asking whether the trait is expressed in the text
  • Different GPT-4 prompt mapping high or moderate trait level to 1 and low to 0
  • Complex prompt with Costa and McCrae high-level definitions, IPIP facet phrases and Goldberg adjective lists
  • Accuracy and macro-F1
  • Per-class precision, recall and F1
  • Invalid-output and shared-invalid-output counts
  • Heuristic F1 threshold of 0.5 for both classes

Datos utilizados

  • Essays: 2,467 stream-of-consciousness essays from 2,467 authors with near-balanced binary trait labels
  • MyPersonality: 255 reported Facebook users with status posts aggregated per author; only 250 class labels per trait are shown
  • Pandora: 14,221 Reddit texts from 1,608 users, with 1–100 scores rescaled and binarized against MyPersonality-derived thresholds
  • No released processed dataset snapshot, label file, model prediction file or parser output located

Evidencia y localización

  • Versión, fecha, autores y abstract: arXiv:2511.23101v1 metadata and title page checked 15 July 2026
  • Datasets, muestras, distribuciones y binarización Pandora: Section 3.1 and Table 1, pages 4–5
  • Modelos y exclusiones: Section 3.2, page 5
  • Prompts, parámetros y parser de respuestas: Sections 3.3–3.4 and footnotes 11–13, pages 5–6; Appendix D, pages 21–28
  • Inválidos y cofallos: Tables 2–3 and Sections 4.1–4.2, pages 6–8
  • Descarte de inválidos y corte F1 0,5: Section 4.3, page 8; Appendix A, page 14
  • Trece configuraciones y métricas exactas: Figures 1–3, pages 9–10; Tables 4–5, pages 15–16
  • Efecto del prompt complejo: Section 4.3.4 and Figures 4–8, pages 10 and 13, 17–20
  • Reproducción aritmética de baselines y contradicciones de tablas: reports/verification/article-181-metric-and-design-audit.json
  • Ausencia de artefactos localizados: Paper, exact-title, arXiv-ID, GitHub and Zenodo searches checked 15 July 2026
  • Inspección visual completa: All 28 pages of arXiv:2511.23101v1 rendered and visually inspected on 15 July 2026