Evaluating Personality Traits in Large Language Models: Insights from Psychological Questionnaires

Evaluación y validez psicométrica2025ACMRevisión editorial aprobada

Autores: Pranav Bhandari, Usman Naseem, Amitava Datta, Nicolas Fay, Mehwish Nasim

Palabras clave: Large Language Models, Personality, Big Five, Persona, Model Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
24
Hallazgos
49
Limitaciones
12
Evidencias

Resumen editorial

Español

Este trabajo de cinco páginas, publicado en WWW Companion 2025, administra cinco inventarios de personalidad reformulados a GPT-4, GPT-4o-mini, Llama-3-8B-Instruct, Llama-3.1-8B-Instruct y Llama-3.2-3B-Instruct. GPT-4o reescribe los ítems; all-MiniLM-L6-v2 exige similitud coseno de al menos 0,7 con el original y los autores indican supervisión humana para reconstruir ítems por debajo del umbral. Los ítems se randomizan, se envían en lotes de diez y se repiten 100 veces con temperatura 0 en OpenAI y 0,01 en Llama. La Tabla 2 publica únicamente la media por modelo, inventario y dimensión. No se localizó código, prompts completos, versiones reformuladas, respuestas crudas ni configuración reproducible. El protocolo no elimina ni mide contaminación de entrenamiento. Una paráfrasis semánticamente próxima puede seguir siendo reconocible y haber sido generada por un modelo que conoce el instrumento; el umbral de similitud evalúa parecido textual, no presencia en datos de entrenamiento. Tampoco valida que la reformulación conserve puntuación, estructura factorial o interpretación psicométrica. El system prompt presenta al modelo como un helpful assistant y le exige autoevaluarse, por lo que las respuestas pueden reflejar alineamiento, obediencia al formato y estereotipos sobre un asistente útil, no rasgos latentes. La selección de instrumentos contiene errores conceptuales. HEXACO-100 mide seis factores; el artículo omite Honestidad-Humildad y fuerza Emotionality/otros dominios a cinco etiquetas Big Five. La escala citada como NEO-PI-R de 60 ítems es realmente IPIP-NEO-60, una representación pública del NEO PI-R. TIPI usa 1–7 y los otros cuatro inventarios se presentan en 1–5. Aun así, la dimensión dominante se calcula promediando sin normalización las cinco medias, dando a TIPI un rango mayor. Una sensibilidad que transforma TIPI linealmente a 1–5 conserva por casualidad las cinco etiquetas dominantes, pero cambia sus medias y no resuelve la falta de equivalencia entre constructos. El coeficiente de variación tampoco mide lo que sugiere el texto. Aunque se mencionan 100 ejecuciones, la Tabla 3 se reproduce, para los tres primeros modelos, calculando desviación estándar poblacional sobre solo cuatro promedios de inventario por dimensión, excluyendo TIPI. Por tanto, Neuroticismo 20,49% en GPT-4 o 33,69% en Llama 3.1 describen desacuerdo entre instrumentos, no fluctuación entre 100 respuestas. No se publican SD o intervalos entre ejecuciones. Las cifras de Llama 3.1 y 3.2 no se reproducen enteramente desde la Tabla 2; en Llama 3.2, el CV publicado de Extraversion 21,93% queda fuera del rango 24,08–25,93% compatible con el redondeo mostrado. Los promedios descriptivos sí muestran un patrón: puntuaciones crudas altas en Agreeableness, Conscientiousness u Openness y bajas en Neuroticism bajo este prompt y estos ítems. La dimensión dominante declarada es Agreeableness para GPT-4, GPT-4o-mini y Llama 3.2, Conscientiousness para Llama 3 y Openness para Llama 3.1. Sin normas humanas, calibración común, incertidumbre, pruebas estadísticas o validación conductual, esos números no establecen perfiles de personalidad. Las interpretaciones causales sobre fine-tuning y objetivos de diseño tampoco se prueban. La conclusión defendible es limitada: cinco modelos alineados producen patrones de respuesta distintos entre cuestionarios y familias bajo un protocolo de autoinforme reformulado. El trabajo sirve para mostrar que instrumento, escala y prompt importan; no demuestra rasgos psicológicos, fiabilidad psicométrica, eliminación de contaminación, personalidad familiar del modelo ni que los perfiles predigan conducta fuera del cuestionario.

English

This five-page WWW Companion 2025 paper administers five reworded personality inventories to GPT-4, GPT-4o-mini, Llama-3-8B-Instruct, Llama-3.1-8B-Instruct, and Llama-3.2-3B-Instruct. GPT-4o rewrites the items; all-MiniLM-L6-v2 requires cosine similarity of at least 0.7 to the original, and the authors state that items below the threshold are reconstructed under human supervision. Items are randomized, sent in batches of ten, and repeated 100 times at temperature 0 for OpenAI and 0.01 for Llama. Table 2 releases only the mean by model, inventory, and dimension. No code, complete prompts, reworded forms, raw responses, or reproducible configuration was located. The protocol neither removes nor measures training-data contamination. A semantically close paraphrase may remain recognizable and may itself have been generated by a model familiar with the instrument; a similarity threshold measures textual resemblance, not presence in training data. It also does not validate preservation of scoring, factor structure, or psychometric meaning. The system prompt frames the model as a helpful assistant and asks it to rate itself, so responses may reflect alignment, format obedience, and stereotypes about a helpful assistant rather than latent traits. Instrument selection contains conceptual errors. HEXACO-100 measures six factors; the paper drops Honesty-Humility and forces Emotionality and the remaining domains into five Big Five labels. The 60-item measure called NEO-PI-R is actually IPIP-NEO-60, a public-domain representation of NEO PI-R. TIPI uses a 1–7 scale while the other four inventories are presented on 1–5 scales. Nevertheless, dominant dimension is computed by averaging all five raw means without normalization, giving TIPI a wider numerical range. A sensitivity check linearly converting TIPI to 1–5 happens to preserve all five dominant labels, but changes their means and does not resolve construct nonequivalence. The coefficient of variation also does not measure what the prose suggests. Although 100 runs are mentioned, Table 3 is reproduced, for the first three models, by taking a population standard deviation over only four questionnaire-level means per dimension, excluding TIPI. Thus GPT-4 Neuroticism at 20.49% or Llama 3.1 at 33.69% describes disagreement among instruments, not fluctuation across 100 responses. No run-level SDs or intervals are reported. The Llama 3.1 and 3.2 figures are not fully reproducible from Table 2; for Llama 3.2, the published Extraversion CV of 21.93% lies outside the 24.08–25.93% range compatible with the displayed rounding. The descriptive averages do show a pattern: under these prompts and items, raw Agreeableness, Conscientiousness, or Openness scores tend to be high and Neuroticism low. The declared dominant dimensions are Agreeableness for GPT-4, GPT-4o-mini, and Llama 3.2, Conscientiousness for Llama 3, and Openness for Llama 3.1. Without human norms, common calibration, uncertainty, statistical tests, or behavioral validation, these numbers do not establish personality profiles. Causal interpretations about fine-tuning and design objectives are not tested. The defensible conclusion is narrow: five aligned models produce different response patterns across inventories and families under a reworded self-report protocol. The work shows that instrument, response scale, and prompt matter; it does not establish psychological traits, psychometric reliability, removal of contamination, model-family personality, or behavioral prediction outside the questionnaire.

Pregunta de investigación

¿Qué patrones de puntuación Big Five producen cinco LLM al responder versiones reformuladas de cinco inventarios, y cuánto difieren los promedios entre dimensiones, instrumentos y familias de modelo?

Método

Estudio descriptivo sin participantes humanos. GPT-4o reformula ítems de BFI, HEXACO-100, TIPI, MINI-IPIP e IPIP-NEO-60; all-MiniLM-L6-v2 calcula similitud con el original y se aplica un umbral de 0,7 con supervisión humana declarada. Cinco LLM reciben los ítems randomizados en lotes de diez mediante un system prompt de autoinforme numérico. Se declaran 100 iteraciones por modelo con temperatura mínima. Se promedian puntuaciones Likert por inventario y dimensión; el CV se calcula sobre cuatro medias de inventario por dimensión, excluyendo TIPI, y la dominancia sobre el promedio crudo de los cinco inventarios.

Muestra: La unidad nominal son cinco modelos: dos OpenAI y tres Llama. El artículo declara 100 iteraciones por modelo y cuestionario, pero no informa cuántas respuestas fallaron, si las repeticiones fueron idénticas a temperatura mínima, ni estadísticas a nivel de ejecución. La Tabla 3 usa cuatro promedios de inventario por dimensión como observaciones del CV, no las 100 iteraciones. No hay muestra humana, normas, jueces ni evaluación conductual.

Hallazgos

  • La versión definitiva es un paper de WWW Companion 2025, DOI 10.1145/3701716.3715504, páginas 868–872, licencia CC BY 4.0.
  • El contenido sustantivo coincide con arXiv:2502.05248v1.
  • Las cinco páginas fueron renderizadas e inspeccionadas visualmente.
  • Se evalúan GPT-4, GPT-4o-mini y tres checkpoints Instruct de Llama 3/3.1/3.2.
  • GPT-4o genera las paráfrasis y all-MiniLM-L6-v2 aplica similitud coseno con umbral 0,7.
  • El artículo declara 100 iteraciones, temperatura 0 para OpenAI y 0,01 para Llama.
  • Los ítems se randomizan y se agrupan en lotes de diez.
  • La Tabla 2 publica medias por modelo, instrumento y dimensión, sin dispersión entre ejecuciones.
  • Agreeableness, Conscientiousness y Openness tienden a tener medias crudas altas; Neuroticism tiende a ser baja.
  • La dominancia publicada es Agreeableness en GPT-4, GPT-4o-mini y Llama 3.2; Conscientiousness en Llama 3; Openness en Llama 3.1.
  • HEXACO-100 tiene seis factores oficiales, pero el análisis conserva solo cinco etiquetas.
  • El instrumento de 60 ítems citado es IPIP-NEO-60, aunque Tabla 1 lo llama NEO-PI-R.
  • TIPI usa 1–7 y los otros inventarios se muestran en 1–5.
  • La media de dominancia mezcla esas escalas sin normalizar.
  • Reescalar TIPI linealmente a 1–5 no cambia las etiquetas dominantes en una sensibilidad, pero reduce las medias.
  • El CV se calcula sobre cuatro medias de cuestionario por dimensión, no sobre las 100 ejecuciones.
  • Los CV de GPT-4, GPT-4o-mini y Llama 3 se reproducen exactamente con desviación estándar poblacional.
  • El CV máximo publicado es Neuroticism 33,69% en Llama 3.1.
  • Con la Tabla 2 redondeada, el CV mínimo de Llama 3.1 es Agreeableness 12,25%, no Openness 12,41% como reporta Tabla 3.
  • El CV de Extraversion de Llama 3.2 se recalcula como 24,98%, no 21,93%.
  • El 21,93% publicado queda fuera del rango posible bajo el redondeo mostrado para esos cuatro promedios.
  • No se encontraron código, datos, prompts completos, ítems reformulados o artefactos de reproducción.
  • El paper no aporta prueba estadística, intervalo o comparación humana.
  • El patrón observado puede reflejar alineamiento de asistente y diseño del prompt tanto como contenido de los inventarios.

Limitaciones

  • Parafrasear ítems no demuestra que los originales o sus equivalentes no estuvieran en los datos de entrenamiento.
  • La similitud coseno mide parecido semántico, no contaminación de entrenamiento.
  • Un umbral mínimo de 0,7 conserva deliberadamente alta similitud con los ítems originales.
  • GPT-4o puede reproducir constructos o lenguaje de instrumentos que conoció durante entrenamiento.
  • No hay prueba de extracción, canary, comparación con ítems nuevos o baseline sin paráfrasis.
  • No se publican los pares original/reformulado ni las puntuaciones de similitud.
  • La supervisión humana no se describe: número de revisores, criterio, desacuerdo o cualificación.
  • No se valida que las paráfrasis preserven clave, polaridad, dificultad o contenido del ítem.
  • No se evalúan fiabilidad interna, test-retest, estructura factorial, convergencia o invariancia de las formas reformuladas.
  • El system prompt helpful assistant puede inducir respuestas socialmente deseables y prosociales.
  • El autoinforme antropomórfico no tiene un referente claro para un modelo sin vida o conducta propia.
  • Las respuestas pueden ser estereotipos semánticos sobre asistentes y no estados internos.
  • No hay condiciones de prompt neutral, tercera persona, observador, comportamiento o diálogo natural.
  • No se publican system/user prompts completos para los cinco instrumentos ni adaptaciones de TIPI.
  • El protocolo dice al menos tres administraciones y luego 100 iteraciones sin reconciliar ambos números.
  • Temperatura 0 o 0,01 no garantiza independencia ni determinismo entre llamadas.
  • No se reportan seed, top-p, max tokens, versión de API, fecha, región o política de backend.
  • No se identifican snapshots de GPT-4, GPT-4o-mini o GPT-4o.
  • No se identifican revisiones exactas, cuantización, hardware o software de Llama.
  • No se documentan errores de formato, reintentos, respuestas inválidas o exclusiones.
  • Las 100 respuestas pueden ser pseudorreplicaciones casi idénticas bajo temperatura mínima.
  • No se publican desviaciones estándar, intervalos o distribuciones entre las 100 ejecuciones.
  • El CV de Tabla 3 usa cuatro promedios de inventario y por tanto tiene n=4 por modelo-dimensión.
  • El texto presenta ese CV junto a n=100, lo que puede inducir a interpretarlo erróneamente como variabilidad entre ejecuciones.
  • No hay intervalos del CV ni análisis de sensibilidad a un solo inventario.
  • La fila de Llama 3.2 no se reproduce desde la Tabla 2 aun considerando el redondeo publicado.
  • La fila de Llama 3.1 selecciona un mínimo distinto del recalculado con los valores visibles.
  • No se aportan cifras de precisión completa que permitan reconciliar las discrepancias.
  • HEXACO mide seis factores y no es simplemente otro inventario Big Five de cinco dimensiones.
  • Se omite Honestidad-Humildad, una dimensión definitoria de HEXACO.
  • Emotionality de HEXACO no equivale sin más a Neuroticism Big Five.
  • El artículo confunde NEO PI-R con IPIP-NEO-60.
  • Los instrumentos difieren en contenido, número de ítems, construcción y propiedades; sus medias crudas no son intercambiables.
  • TIPI usa 1–7 y los otros inventarios 1–5, pero la dominancia promedia los cinco valores crudos.
  • No se estandarizan puntuaciones por rango, normas o error de medición.
  • La dimensión con media más alta no es una definición validada de rasgo dominante.
  • No hay normas humanas que indiquen si una media es alta, baja o típica para cada instrumento.
  • No se comparan modelos con humanos bajo los mismos ítems reformulados.
  • No hay tests de significación, tamaños de efecto, corrección múltiple o hipótesis preregistradas.
  • Cinco modelos no sostienen inferencias generales sobre familias, tamaño o fine-tuning.
  • Dentro de cada familia cambian tamaño, generación, datos y alineamiento simultáneamente.
  • Las atribuciones a objetivos de fine-tuning y diseño son especulativas: no hay ablación o acceso a entrenamiento.
  • Los radar plots pueden sugerir comparabilidad aunque cada inventario tenga propiedades distintas.
  • No se evalúa estabilidad temporal, cambio de backend o sensibilidad a orden/lote.
  • Randomizar y agrupar por diez puede cambiar el contexto; no se separa ese efecto del contenido del ítem.
  • No hay validación en tareas conductuales, preferencias, diálogo o decisiones reales.
  • No se evalúan otros idiomas, culturas, modelos base, system prompts o configuraciones.
  • No se discuten privacidad, daño o uso inapropiado de perfiles de personalidad.
  • No se localizó código, dataset, protocolo preregistrado o material suplementario.

Qué no demuestra

  • No establece que los LLM posean rasgos psicológicos o una personalidad estable.
  • No elimina ni cuantifica contaminación de entrenamiento.
  • No valida psicométricamente los cuestionarios reformulados para LLM.
  • No demuestra que HEXACO, Big Five e IPIP midan dimensiones equivalentes en modelos.
  • No demuestra variabilidad entre las 100 ejecuciones mediante el CV publicado.
  • No demuestra que una media cruda más alta sea una dimensión dominante comparable.
  • No demuestra que GPT-4 sea más agreeable o Llama 3.1 más open en sentido humano.
  • No demuestra efectos causales de fine-tuning, tamaño o familia de modelo.
  • No demuestra consistencia fuera del prompt de helpful assistant.
  • No predice comportamiento del modelo en interacción natural.
  • No ofrece cifras completamente reproducibles para Llama 3.1 y 3.2.
  • No permite replicación sin ítems, outputs, snapshots, seeds y código.

Trazabilidad

Alcance: Texto completo

Versión: WWW Companion '25, Companion Proceedings of the ACM Web Conference 2025, pages 868–872, DOI 10.1145/3701716.3715504, CC BY 4.0; content checked against arXiv:2502.05248v1

Fuente consultada: https://doi.org/10.1145/3701716.3715504

Revisión: Codex complete bilingual full-text fidelity pass, definitive publisher-version reconciliation, all-page PDF visual inspection, table arithmetic reproduction, response-scale sensitivity analysis, instrument-identity verification against primary sources, contamination-claim audit, psychometric-validity and reproducibility assessment; summaries written from the complete published paper and recalculated tables rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4; exact snapshot, provider endpoint and run date not reported
  • GPT-4o-mini; exact snapshot and run date not reported
  • Llama-3-8B-Instruct; exact checkpoint revision and runtime not reported
  • Llama-3.1-8B-Instruct; exact checkpoint revision and runtime not reported
  • Llama-3.2-3B-Instruct; exact checkpoint revision and runtime not reported
  • GPT-4o as the questionnaire-rewording model; exact snapshot and prompt not reported
  • sentence-transformers/all-MiniLM-L6-v2 for cosine-similarity screening

Instrumentos y métricas

  • Big Five Inventory, 44 items, reported 1–5 response scale
  • HEXACO-PI-R 100-item form, reduced by the paper from six factors to five reported dimensions
  • Ten-Item Personality Inventory, 10 items, official 1–7 response scale
  • Mini-IPIP, 20 items, reported 1–5 response scale
  • IPIP-NEO-60, mislabeled NEO-PI-R in Table 1, 60 items and reported 1–5 scale
  • GPT-4o paraphrasing followed by all-MiniLM-L6-v2 cosine similarity threshold 0.7
  • Helpful-assistant numeric self-rating system prompt
  • Unweighted raw mean across inventories for dimensional dominance
  • Population coefficient of variation across four questionnaire averages per dimension

Datos utilizados

  • No human participant dataset
  • Five questionnaire response matrices generated by five LLMs across 100 declared iterations
  • Only rounded aggregate means in Table 2 are published
  • No released reformulated items, run-level outputs, order permutations, seeds, logs or scoring files

Evidencia y localización

  • Publicación definitiva, DOI, licencia y paginación: WWW Companion '25 publisher version, page 868, DOI 10.1145/3701716.3715504; Macquarie and UWA publication records checked 15 July 2026
  • Prompt y conjunto de cinco instrumentos: Published paper Figure 1 and Table 1, pages 869–870
  • Paráfrasis, similitud, temperatura y randomización: Published paper Sections 2.1–2.2, page 870
  • Modelos, 100 iteraciones y cálculo declarado del CV: Published paper Sections 2.2–3, page 870
  • Medias de los cinco modelos e instrumentos: Published paper Table 2, page 870
  • CV, dominancia y exclusión de TIPI del CV: Published paper Table 3 and Sections 3.1–3.3, pages 870–871
  • Reproducción aritmética, límites de redondeo y sensibilidad de escalas: reports/verification/article-179-table-audit.json
  • HEXACO tiene seis factores: Official HEXACO-PI-R inventory website checked 15 July 2026
  • Identidad de IPIP-NEO-60: Maples-Keller et al. IPIP-NEO-60 paper cited as reference 8 and PubMed record checked 15 July 2026
  • Escala oficial 1–7 de TIPI: Official Gosling TIPI instrument and scoring page checked 15 July 2026
  • Ausencia de código y artefactos: Exact-title, DOI, arXiv-ID and GitHub searches checked 15 July 2026
  • Inspección visual completa: All five pages of the definitive WWW Companion '25 PDF rendered and visually inspected on 15 July 2026