Self-Assessment Tests are Unreliable Measures of LLM Personality

Evaluación y validez psicométrica2024ACL AnthologyRevisión editorial aprobada

Título original: Self-Reports are Unreliable Measures of LLM Personality

Autores: Akshat Gupta, Xiaoyang Song, Gopala Anumanchipalli

Palabras clave: Large Language Models, Personality Assessment, Prompt Sensitivity, Option-Order Symmetry, NLP

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
13
Hallazgos
23
Limitaciones
12
Evidencias

Resumen editorial

Español

Gupta, Song y Anumanchipalli someten la administración directa de cuestionarios humanos a dos controles sencillos: sensibilidad al prompt y simetría ante el orden de las opciones. Usan los 300 ítems IPIP-NEO, 60 por cada dominio OCEAN, con ChatGPT/gpt-3.5-turbo y Llama 2 Chat de 7B, 13B y 70B. Cada ítem se presenta mediante tres plantillas tomadas de trabajos previos: elegir A–E según la exactitud de una autodescripción, responder 1–5 según cuánto se parece al modelo una descripción y puntuar 1–5 el grado de acuerdo. Después se invierte el orden de A–E, el significado de 1–5 o la dirección agree–disagree, y el scoring se vuelve a orientar para que 5 conserve el significado de mayor presencia del rasgo.

Las medias cambian de forma material. En ChatGPT, por ejemplo, la apertura pasa de 4,48 con Prompt-1 a 3,32 con Prompt-2 y 2,57 con Prompt-3; consciencia de 4,35 a 3,30 y 2,53; extraversión de 4,57 a 3,22 y 2,47. La inversión también desplaza resultados: el Prompt-3 original de ChatGPT produce 2,47–2,68 según rasgo y el invertido 3,22–3,60. Los Llama muestran otros patrones, no una escala común. Con Mann–Whitney U a α=0,05, el paper declara diferencias en 29/30 contrastes para ChatGPT, 24/30 para Llama-2-7B, 26/30 para 13B y 19/30 para 70B. Esta evidencia apoya con fuerza que un score aislado depende de decisiones administrativas que no deberían definir una personalidad.

La inferencia estadística publicada, sin embargo, no respeta el diseño. Cada comparación contiene los mismos ítems bajo dos condiciones, por lo que las observaciones están emparejadas; Mann–Whitney supone muestras independientes. Tampoco se corrigen 30 contrastes por modelo, no se informan tamaños de efecto o intervalos, y los outputs inválidos se eliminan silenciosamente. El texto dice que cada distribución contiene 60 observaciones, pero el artefacto oficial solo permite puntuar 6.891 de 7.200 respuestas: ChatGPT conserva 1.799/1.800 y los Llama 1.673, 1.708 y 1.711; algunas celdas tienen 47–59 respuestas, no 60.

La auditoría recalculó los contrastes en los mismos outputs, emparejando por ítem. Wilcoxon sin corrección mantiene 29/30 diferencias en ChatGPT, 23/30 en 7B, 24/30 en 13B y 21/30 en 70B. Tras Benjamini–Hochberg dentro de los 30 contrastes de cada modelo quedan 29, 22, 23 y 18. El patrón principal sobrevive, pero las cifras publicadas no deben repetirse como si fueran una prueba exacta de fiabilidad. Además, las tres plantillas no son estrictamente equivalentes: preguntan por exactitud descriptiva, semejanza con una persona y acuerdo, con anclajes y pragmática distintos. Parte de la variación puede ser sensibilidad indeseable y parte respuesta a marcos de medida realmente diferentes.

El trabajo acierta al exigir que cualquier score de personalidad sea estable ante controles razonables y al recordar que preguntas como «me gusta ser el centro de atención» presuponen memoria autobiográfica e introspección. No obstante, estudia una sola escala, un idioma, cuatro modelos de 2023, seis formatos y una ejecución casi determinista. Demuestra que esta administración directa de IPIP-300 no ofrece scores robustos bajo sus condiciones; no demuestra que toda forma futura de medir tendencias de un modelo sea imposible ni resuelve qué significaría «personalidad» en una máquina.

English

Gupta, Song, and Anumanchipalli subject direct administration of human questionnaires to two simple controls: prompt sensitivity and symmetry under option order. They use all 300 IPIP-NEO items, 60 for each OCEAN domain, with ChatGPT/gpt-3.5-turbo and Llama 2 Chat at 7B, 13B, and 70B. Every item is presented through three templates taken from prior work: choose A–E for the accuracy of a self-description, answer 1–5 for how much a described person resembles the model, and rate 1–5 agreement with the statement. They then reverse A–E order, the meaning of the 1–5 anchors, or the agree–disagree direction, and recode scores so that 5 continues to represent greater trait presence.

Mean scores change materially. For ChatGPT, Openness moves from 4.48 under Prompt 1 to 3.32 under Prompt 2 and 2.57 under Prompt 3; Conscientiousness moves from 4.35 to 3.30 and 2.53; Extraversion from 4.57 to 3.22 and 2.47. Reversal also shifts results: original Prompt 3 yields 2.47–2.68 across ChatGPT traits, while its reversed form yields 3.22–3.60. The Llama models show different patterns rather than a common scale. Using Mann–Whitney U at alpha 0.05, the paper reports differences in 29/30 contrasts for ChatGPT, 24/30 for Llama-2-7B, 26/30 for 13B, and 19/30 for 70B. This strongly supports the claim that an isolated score depends on administrative choices that should not define a personality.

The published statistical inference does not match the design, however. Each comparison contains the same items under two conditions, so observations are paired; Mann–Whitney assumes independent samples. The analysis also leaves 30 tests per model uncorrected, reports no effect sizes or intervals, and silently drops invalid outputs. The prose says each distribution contains 60 observations, but the official artifact yields only 6,891 scorable responses out of 7,200: ChatGPT retains 1,799/1,800 and the three Llama models retain 1,673, 1,708, and 1,711; some cells contain 47–59 responses rather than 60.

The audit recalculated all contrasts from the same outputs while pairing by item. Uncorrected Wilcoxon tests retain 29/30 differences for ChatGPT, 23/30 for 7B, 24/30 for 13B, and 21/30 for 70B. After Benjamini–Hochberg correction within each model's 30 contrasts, 29, 22, 23, and 18 remain. The main pattern survives, but the published counts should not be repeated as an exact reliability result. The three templates are also not strictly equivalent: they ask about descriptive accuracy, resemblance to another person, and agreement, with different anchors and pragmatics. Some variation may be undesirable prompt sensitivity, while some may be a response to genuinely different measurement frames.

The paper is right to require personality scores to survive reasonable controls and to note that items such as liking to be the center of attention presuppose autobiographical memory and introspection. It nevertheless studies one inventory, one language, four 2023-era models, six formats, and one near-deterministic run. It establishes that this direct administration of IPIP-300 does not yield robust scores under the tested conditions; it does not show that every future method for measuring model tendencies is impossible, nor does it resolve what machine personality should mean.

Pregunta de investigación

¿Los scores Big Five obtenidos al administrar IPIP-300 directamente a un LLM permanecen comparables cuando se cambia entre tres plantillas plausibles y cuando se invierte el orden o la dirección de sus opciones de respuesta?

Método

Experimento factorial de robustez de administración. Cuatro chat models responden los 300 ítems IPIP-NEO bajo tres prompts originales y sus tres versiones con orden/escala invertidos, para un máximo nominal de 7.200 respuestas. Los ítems inversos y las escalas invertidas se recodifican a 1–5; se calculan media y desviación por 60 ítems de cada rasgo. El artículo usa Mann–Whitney U para tres comparaciones de plantilla y tres original–invertida por rasgo y modelo. La auditoría leyó y renderizó las 14 páginas, examinó el repositorio oficial en el commit f5da8dc08f890c8c6df1de57e0cd55143b89768d, reprodujo la Tabla 3, contó outputs puntuables y repitió los 30 contrastes de cada modelo con Wilcoxon emparejado y corrección Benjamini–Hochberg.

Muestra: No hay participantes humanos. La unidad repetida es cada uno de los 300 ítems fijos, administrado seis veces a cada modelo; cada rasgo aporta como máximo 60 pares. ChatGPT conserva 1.799 de 1.800 respuestas y Llama-2-7B, 13B y 70B conservan respectivamente 1.673, 1.708 y 1.711. Por condición/rasgo, ChatGPT tiene 59–60 scores, Llama-2-7B 47–60, 13B 50–60 y 70B 51–60. Para el reanálisis emparejado, las intersecciones de respuestas válidas abarcan 43–60 ítems. El paper declara temperatura 0,01 y top-p 1; el código Llama pasa esos valores, pero el script OpenAI no pasa la variable y ejecuta el valor por defecto de la función, temperatura 0.

Hallazgos

  • ChatGPT cambia sistemáticamente de scores altos con Prompt-1 a intermedios con Prompt-2 y bajos con Prompt-3: O 4,48/3,32/2,57; C 4,35/3,30/2,53; E 4,57/3,22/2,47; A 3,72/3,08/2,68; N 4,27/3,20/2,52.
  • La escala invertida del Prompt-3 desplaza ChatGPT a O 3,60, C 3,53, E 3,60, A 3,22 y N 3,55 aun después de recodificar la dirección.
  • Llama-2-13B muestra un contraste extremo entre Prompt-2 y Prompt-3: apertura 2,11 frente a 4,43 y neuroticismo 2,47 frente a 4,64.
  • Los tres tamaños Llama no siguen un patrón monotónico común; cada plantilla y orden interactúa de forma distinta con cada modelo.
  • El paper reproduce 15/15 contrastes de sensibilidad significativos en ChatGPT, 11/15 en Llama-2-70B, 15/15 en 13B y 11/15 en 7B.
  • Para original frente a orden/escala invertida, Mann–Whitney marca 14/15 en ChatGPT, 8/15 en 70B, 11/15 en 13B y 13/15 en 7B.
  • Los totales publicados son por tanto 29/30, 19/30, 26/30 y 24/30 para ChatGPT, Llama-2-70B, 13B y 7B, respectivamente.
  • Esos mismos totales se reproducen desde los JSON y parsers liberados, aunque los scripts estadísticos y de figuras no están publicados.
  • Wilcoxon emparejado sin corrección da 29/30, 21/30, 24/30 y 23/30 en ese mismo orden de modelos.
  • Tras Benjamini–Hochberg sobre los 30 tests de cada modelo quedan 29/30, 18/30, 23/30 y 22/30; la dependencia del formato sigue siendo extensa.
  • Los parsers descartan 309 de 7.200 outputs y la tasa de descarte depende del modelo y prompt, por lo que la capacidad de obedecer el formato también forma parte del resultado.
  • La ausencia de ground truth impide seleccionar un prompt como versión correcta solo porque produce scores más intuitivos; la estabilidad entre administraciones es un requisito previo razonable.
  • El artículo concluye que no debe cuantificarse la personalidad de estos LLM con scores aislados de autoinforme IPIP y pide medidas más robustas.

Limitaciones

  • Las condiciones están emparejadas por ítem, pero Mann–Whitney U trata las muestras como independientes; Wilcoxon o una prueba de permutación pareada respeta mejor el diseño.
  • Mann–Whitney no es en general una prueba de igualdad completa de distribuciones como afirma la hipótesis nula del texto; sin supuestos adicionales evalúa orden estocástico/rangos.
  • Se realizan 30 tests por modelo y 120 en total a α=0,05 sin corrección por multiplicidad.
  • No se informan tamaños de efecto pareados, intervalos, diferencias absolutas medias, correlaciones entre administraciones o un criterio previo de equivalencia práctica.
  • Los 60 ítems son un conjunto fijo del instrumento, no 60 sujetos independientes; el objetivo de generalización estadística a un universo de ítems no se define.
  • El texto afirma que cada distribución tiene 60 muestras, pero los parsers eliminan respuestas que no contienen exactamente una opción reconocible y dejan hasta 47 por celda.
  • La eliminación depende de modelo y prompt y no se analiza como missingness; comparar solo respuestas válidas puede cambiar medias y p-valores de forma no aleatoria.
  • Las tres plantillas no son semánticamente idénticas: descriptive accuracy, likeness to a person y agreement activan marcos pragmáticos y anclajes distintos.
  • Prompt-1 y Prompt-2 difieren además en posición del ítem, índices, separadores, instrucciones de incertidumbre y wording de la categoría neutral; el experimento no aísla qué componente causa el cambio.
  • Los autores adaptan a cinco puntos prompts tomados de estudios distintos, de modo que no replican exactamente todas las administraciones originales que se citan.
  • Medias y desviaciones sobre scores ordinales son descriptivas, pero no modelan umbrales, aquiescencia, uso de categorías ni funcionamiento diferencial de ítems.
  • Una ejecución casi determinista por condición no mide estabilidad temporal, entre servidores, semillas o muestreos; el propio paper reconoce que temperaturas superiores cambian respuestas.
  • El paper declara temperatura 0,01 para todos, pero query_openai_api.py llama ask_gpt_chat sin pasarla y usa el default 0; la configuración real de ChatGPT difiere de la descrita.
  • gpt-3.5-turbo es un alias sin snapshot ni fecha de llamada, y los Llama no fijan revisión de weights/tokenizer, semilla, software de servidor o hardware.
  • El repositorio no contiene README, licencia, requirements/lockfile, notebook o script para Mann–Whitney, heatmaps y Figura 3; publica outputs y parsers de score, pero no una reproducción extremo a extremo.
  • Los parsers son específicos por modelo y aceptan patrones diferentes; no se valida manualmente una muestra de descartes ni se publica acuerdo sobre el parsing.
  • La sección 3.3 describe por error la prueba de simetría como P1R–P2R, P2R–P3R y P1R–P3R; los totales reportados solo se reproducen con P1O–P1R, P2O–P2R y P3O–P3R.
  • Las Figuras 4–6 etiquetan el panel inferior izquierdo de Agreeableness como «Trait E», duplicando la etiqueta de extraversión.
  • IPIP-300 fue validado para autoinforme humano; los ítems sobre recuerdos, emociones, ocio, promesas o comportamiento social no tienen referente literal equivalente en un LLM sin cuerpo ni autobiografía.
  • Solo se estudian cuatro chat models de 2023, en inglés, con un inventario y seis administraciones; no se incluyen modelos base, actuales, otros instrumentos, idiomas o evaluaciones conductuales.
  • GPT-4 y PaLM se excluyen porque según los autores sus salvaguardas impiden responder, pero no se publica un protocolo o tasa de rechazo para ese intento.
  • La recomendación de no usar autoinformes como medida de comportamiento «en ninguna capacidad» excede la evidencia de un inventario y conjunto limitado de prompts.
  • No se propone ni valida una alternativa, limitación que el propio artículo reconoce.

Qué no demuestra

  • No demuestra que los cuatro modelos tengan puntuaciones Big Five verdaderas diferentes entre sí.
  • No permite elegir cuál de los seis prompts refleja mejor una tendencia del modelo; no hay criterio externo o ground truth.
  • No demuestra que toda variación sea un fallo: parte puede proceder de marcos de respuesta semántica y pragmáticamente distintos.
  • No demuestra fiabilidad o invalidez de todos los instrumentos psicológicos; evalúa IPIP-NEO-300 administrado como autoinforme directo.
  • No prueba que los LLM carezcan de patrones conductuales, estilos o preferencias estables observables por otros métodos.
  • No prueba que los LLM posean introspección, memoria autobiográfica o personalidad humana.
  • No estima consistencia interna, test–retest temporal, validez convergente, discriminante, criterial, predictiva o invariancia de medida.
  • No justifica interpretar los p-valores publicados como evidencia sobre sujetos independientes o una población de LLM.
  • No demuestra que las cifras exactas 29, 24, 26 y 19 sean robustas al test emparejado y la multiplicidad; el patrón general sí sobrevive la corrección editorial.
  • No generaliza a modelos posteriores, otros idiomas, respuestas abiertas, prompts conductuales o observación longitudinal.
  • No demuestra que una plantilla optimizada con criterios externos no pueda producir medidas útiles; muestra que una única elección no controlada es insuficiente.
  • No ofrece una definición operacional final de personalidad de máquina ni un sustituto validado para IPIP.
  • No respalda el uso de estos scores en selección, diagnóstico, seguridad, personalización o decisiones de alto impacto.

Trazabilidad

Alcance: Texto completo

Versión: BlackboxNLP 2024 workshop paper, pp. 301–314, DOI 10.18653/v1/2024.blackboxnlp-1.20; final 14-page proceedings version with appendices

Fuente consultada: https://aclanthology.org/2024.blackboxnlp-1.20.pdf

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI gpt-3.5-turbo, reported as ChatGPT
  • meta-llama/Llama-2-7b-chat-hf
  • meta-llama/Llama-2-13b-chat-hf
  • meta-llama/Llama-2-70b-chat-hf

Instrumentos y métricas

  • IPIP-NEO-300 public-domain Big Five inventory
  • Five OCEAN domains with 60 items each
  • Prompt 1: alphabet-indexed descriptive accuracy MCQ
  • Prompt 2: numeric-indexed person-similarity MCQ
  • Prompt 3: non-MCQ agreement scale
  • Reverse option order or reverse scale direction for each prompt
  • Reverse-key scoring normalized to a 1–5 trait direction
  • Mean and population standard deviation across item scores
  • Mann–Whitney U tests at alpha 0.05
  • Editorial reanalysis with paired Wilcoxon and Benjamini–Hochberg FDR

Datos utilizados

  • 300 English IPIP-NEO items, 60 per OCEAN trait
  • Six prompt conditions per item and model
  • 7,200 nominal model responses: 4 models × 300 items × 6 prompts
  • 6,891 responses accepted by the authors' model-specific scoring parsers
  • Official LLM_Personality repository and raw JSON outputs at commit f5da8dc08f890c8c6df1de57e0cd55143b89768d

Evidencia y localización

  • Publicación, autores, alcance y conclusión central: BlackboxNLP 2024 final paper, abstract and section 1, pp. 301–302
  • IPIP-300, cinco rasgos y 60 ítems por rasgo: Final paper, sections 2.1–2.2, pp. 302–303; Appendix Table 2, p. 312
  • Cuatro modelos, temperatura y exclusión de modelos base/GPT-4/PaLM: Final paper, section 1, p. 302, and opening of section 3, p. 303
  • Tres plantillas y diferencias de administración: Final paper, Table 1 and section 3.1, pp. 304–305
  • Scores por prompt y orden invertido: Final paper, Figure 1, sections 3.1–3.2, pp. 305–306; Appendix Table 3, p. 312
  • Mann–Whitney, 60 muestras declaradas y esquema de comparaciones: Final paper, section 3.3, pp. 306–307
  • Totales 29/30, 19/30, 26/30 y 24/30: Final paper, Figure 3 and section 3.3, pp. 307–308
  • Recomendación, introspección y ausencia de alternativa: Final paper, sections 4–5, pp. 308–309
  • P-valores y error de etiqueta de Agreeableness: Final paper, Appendix Figures 4–6, pp. 313–314
  • Outputs válidos, configuración real y reproducibilidad del score: Official akshat57/LLM_Personality repository commit f5da8dc08f890c8c6df1de57e0cd55143b89768d, Data/Outputs_300, query_openai_api.py and model-specific calculate_score scripts, audited 15 Jul 2026
  • Reanálisis emparejado y FDR: Editorial recomputation from official item-level JSON outputs and released scoring logic: paired Wilcoxon on common valid item indices, Benjamini–Hochberg within each model's 30 planned contrasts, 15 Jul 2026
  • Metadatos bibliográficos finales: ACL Anthology 2024.blackboxnlp-1.20, pp. 301–314, DOI 10.18653/v1/2024.blackboxnlp-1.20, verified 15 Jul 2026