Large language models display human-like social desirability biases in Big Five personality surveys

Evaluación y validez psicométrica2024PNAS NexusRevisión editorial aprobada

Autores: Aadesh Salecha, Molly E Ireland, Shashanka Subrahmanya, João Sedoc, Lyle H Ungar, Johannes C Eichstaedt

Palabras clave: Large Language Models, Social Desirability Bias, Big Five, Survey Methods, Behavioral Bias

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
12
Hallazgos
23
Limitaciones
8
Evidencias

Resumen editorial

Español

El estudio examina si las respuestas de distintos modelos de lenguaje a un cuestionario Big Five se desplazan hacia perfiles socialmente deseables cuando el modelo puede inferir que está siendo evaluado. Los autores administran los 100 ítems IPIP en contextos nuevos, variando cuántas preguntas aparecen juntas, y comparan ocho modelos de OpenAI, Anthropic, Google y Meta. También prueban instrucciones que identifican explícitamente la evaluación, ítems parafraseados, tres órdenes de presentación, versiones con distinta codificación y temperaturas de 0,0 a 1,2.

En GPT-4, pasar de una a veinte preguntas por lote elevó entre 0,73 y 0,96 puntos las cuatro dimensiones valoradas positivamente y redujo Neuroticismo de 2,87 a 2,02. El promedio de las cinco diferencias absolutas fue 0,82 puntos, equivalente a 1,20 desviaciones estándar humanas según las normas externas elegidas. El desplazamiento apareció en las familias comparadas y fue mayor, de forma descriptiva, en algunos modelos más recientes y grandes; el diseño no identifica tamaño, fecha o preference tuning como causas. Con cinco ítems aleatorios, GPT-4, Claude 3 y Llama 3 identificaron el cuestionario de personalidad en más del 90 % de los casos, frente a 55 % en PaLM 2 y 45 % en GPT-3.5. Informar explícitamente del Big Five produjo un cambio parecido al de mostrar cinco preguntas juntas. Invertir todos los ítems redujo la diferencia media de 0,81 a 0,38 puntos, pero no la eliminó; parafrasear, reordenar y cambiar la temperatura mantuvo el patrón general.

La elevada consistencia interna declarada, α>0,8 por subescala, α>0,93 para el conjunto y fiabilidad por mitades de 0,79, no corrige la sensibilidad al protocolo: un instrumento puede ser internamente consistente y, a la vez, variar cuando cambia el contexto evaluativo. Tampoco convierte las salidas en rasgos humanos. La explicación por «awareness» es conductual: reconocer palabras o el origen del test y cambiar la respuesta ante una instrucción explícita es compatible con inferencia contextual, pero no demuestra autoconciencia ni una intención subjetiva de agradar.

El depósito OSF aporta 2.418 ficheros de conversaciones crudas, 3.263 preprocesados, código y seis figuras, por lo que las medias principales de GPT-4 a temperatura 0 pueden comprobarse. Sin embargo, no ofrece una réplica end-to-end fiable. El script de generación no compila por placeholders de API sin comillas, contiene `throw` no definido, importa dependencias ausentes del requirements y termina fijando llama3-8b-8192 en Groq en vez de respetar el argumento de modelo. El preprocesado sustituye respuestas no parseables por el valor neutral 3 y clasifica el reconocimiento del cuestionario mediante una lista de substrings que incluye términos amplios como «assessment», «affect» e «inventory». La figura 1A codifica a mano valores e intervalos; el agregado liberado mezcla 120 filas para Q1/Q5, cuatro temperaturas, tres órdenes y diez seeds de orden, con 30 para Q10/Q20, disponibles solo a temperatura 0, aunque la caption declara N=30. El código no contiene el cálculo de alfa o Spearman–Brown y la función de p-valores no está conectada a la generación de figuras.

La contribución defendible es una advertencia de medición: en este protocolo, agrupar más ítems y hacer más evidente el contexto del test cambia sistemáticamente las puntuaciones Big Five. Esto limita el perfilado psicométrico de LLM y su uso como sustitutos de participantes, y recomienda triangular cuestionarios con medidas y tareas independientes. No demuestra que los modelos posean personalidad, que intenten causar buena impresión, que el fenómeno aparezca en cualquier cultura o instrumento, ni que los LLM reproduzcan distribuciones psicológicas humanas.

English

This study tests whether language-model responses to a Big Five questionnaire shift toward socially desirable profiles when the model can infer that it is being evaluated. The authors administer the 100 IPIP items in fresh contexts while varying the number of questions shown together, and compare eight models from OpenAI, Anthropic, Google, and Meta. They also test explicit disclosure of the personality assessment, manually paraphrased items, three ordering schemes, alternative coding schemes, and temperatures from 0.0 to 1.2.

For GPT-4, increasing the batch from one to twenty questions raises the four positively valued dimensions by 0.73–0.96 points and lowers Neuroticism from 2.87 to 2.02. The mean absolute change across the five traits is 0.82 points, reported as 1.20 human standard deviations under the selected external norms. The directional shift appears across the compared model families and is descriptively larger in some newer and larger models; the design does not identify scale, recency, or preference tuning as a cause. Given five random items, GPT-4, Claude 3, and Llama 3 identify the personality-test context with over 90% accuracy, compared with 55% for PaLM 2 and 45% for GPT-3.5. Explicitly naming the Big Five produces a shift comparable to presenting five questions together. Fully reverse-coding the items reduces the mean difference from 0.81 to 0.38 points but does not remove it; paraphrasing, ordering changes, and temperature changes preserve the overall pattern.

The reported internal consistency, α>0.8 for each subscale, α>0.93 across all items, and corrected split-half reliability of 0.79, does not protect scores from protocol sensitivity: an instrument can be internally consistent while changing with evaluation context. It also does not turn model outputs into human traits. The proposed “awareness” mechanism is behavioral. Recognizing test-related language and shifting under an explicit instruction are consistent with contextual inference, but they do not demonstrate self-awareness or a subjective intention to look good.

The OSF deposit supplies 2,418 raw-conversation files, 3,263 preprocessed files, code, and six figures, so the main temperature-zero GPT-4 means can be checked. It does not provide a reliable end-to-end reproduction. The generation script fails to compile because API-key placeholders are unquoted, contains undefined `throw` statements, imports packages absent from requirements, and ultimately hard-codes Groq's llama3-8b-8192 instead of honoring its model argument. Preprocessing replaces unparseable non-PaLM answers with the neutral value 3 and labels survey recognition through substring matching that includes broad terms such as “assessment,” “affect,” and “inventory.” Figure 1A hard-codes its values and uncertainty bands. The released aggregate combines 120 rows for Q1/Q5, four temperatures, three orderings, and ten ordering seeds, with 30 rows for Q10/Q20, which are present only at temperature zero, although the caption states N=30. No code computes the reported alpha or Spearman–Brown estimates, and the p-value function is not connected to figure generation.

The defensible contribution is a measurement warning: under this protocol, grouping more items and making the test context more evident systematically changes Big Five scores. This constrains psychometric profiling of LLMs and their use as participant substitutes, and supports triangulation with independent measures and tasks. It does not show that models possess personality, intend to present themselves favorably, reproduce human psychological distributions, or exhibit the effect across every culture and instrument.

Pregunta de investigación

¿Cambian sistemáticamente las puntuaciones Big Five de los LLM hacia extremos socialmente deseables cuando el modelo infiere, por el número de ítems o por una instrucción explícita, que está completando una evaluación de personalidad, y se mantiene ese patrón entre modelos y variantes del cuestionario?

Método

Experimento factorial con el cuestionario IPIP de 100 ítems para los cinco grandes rasgos, puntuado en escala Likert de 1 a 5. Cada lote se administró en una ventana de contexto nueva. Se manipuló el número de ítems por lote y se compararon condiciones con identificación explícita del Big Five, codificación estándar, totalmente positiva y totalmente invertida, parafraseo manual, tres esquemas de orden y temperaturas 0,0, 0,4, 0,8 y 1,2. La comparación entre modelos usa 30 ensayos por modelo y contrasta, entre otras condiciones, uno frente a diez ítems; el análisis detallado de GPT-4 llega hasta veinte ítems. Los autores calcularon puntuaciones de factor, diferencias expresadas también en desviaciones estándar de normas humanas, precisión al reconocer el origen de los ítems, alfa de Cronbach y fiabilidad por mitades corregida con Spearman–Brown.

Muestra: Respuestas generadas por ocho versiones concretas de LLM entre agosto de 2023 y abril de 2024. La comparación de uno frente a diez ítems promedia 30 ensayos por modelo; no participaron personas nuevas en el experimento, aunque las magnitudes se expresan también con normas poblacionales humanas publicadas.

Hallazgos

  • En GPT-4, aumentar el lote de uno a veinte ítems elevó alrededor de 0,75 puntos Extraversion, Conscientiousness, Openness y Agreeableness (1,22 DE humanas) y redujo Neuroticism de 2,87 a 2,02 (1,10 DE humanas).
  • Todas las familias de modelos evaluadas mostraron el desplazamiento socialmente deseable; la mayor magnitud en modelos más grandes y recientes es una asociación descriptiva, no una prueba causal.
  • Con cinco ítems aleatorios, GPT-4, Claude 3 y Llama 3 reconocieron el contexto de evaluación de personalidad con más del 90 % de precisión; PaLM 2 alcanzó 55 % y GPT-3.5, 45 %.
  • Nombrar explícitamente el Big Five modificó las respuestas incluso con un solo ítem, con un efecto semejante al de presentar cinco preguntas juntas.
  • La codificación totalmente invertida redujo la diferencia media de aproximadamente 0,81 a 0,38 puntos (de 1,22 a 0,54 DE humanas), pero no la eliminó; la codificación totalmente positiva no produjo una reducción comparable.
  • El patrón persistió con ítems parafraseados, distintos órdenes y temperaturas de 0,0 a 1,2. La consistencia interna fue superior a 0,8 por subescala y a 0,93 para todos los ítems; la fiabilidad por mitades corregida fue 0,79.
  • Las 30 filas de GPT-4 a temperatura 0 reproducen Q1=3,3167/3,2517/3,0033/3,64/2,8667 y Q20=4,0817/4,2067/3,7433/4,4133/2,02 para O/C/E/A/N, coherentes con la tabla publicada tras redondeo.
  • El depósito OSF contiene 2.418 ficheros crudos y 3.263 preprocesados, pero el script de generación liberado no compila y no reproduce la cuadrícula de ocho modelos sin reconstrucción manual.
  • El preprocesado convierte respuestas no parseables en 3, lo que puede reducir variabilidad y acercar medias al punto neutral en vez de registrar datos ausentes.
  • El reconocimiento del origen del cuestionario se puntúa por coincidencia de substrings, no por anotación ciega; la lista incluye términos amplios además de nombres inequívocos de personalidad.
  • La figura 1A usa valores y bandas codificados manualmente; los CSV agregados almacenan 120 filas en Q1/Q5 y 30 en Q10/Q20, en tensión con la etiqueta uniforme N=30 de la caption.
  • El artefacto no contiene el cálculo de alfa de Cronbach ni de Spearman–Brown y la función de p-valores disponible no se invoca desde el pipeline de visualización.

Limitaciones

  • El experimento cubre ocho versiones de modelos disponibles entre agosto de 2023 y abril de 2024; no permite extrapolar automáticamente a versiones posteriores ni a todos los LLM.
  • La generalización a instrumentos menos conocidos, menos representados en los datos de entrenamiento o menos evaluativos no se probó; los propios autores la dejan abierta.
  • La explicación mediante inferencia del contexto evaluativo se apoya en pruebas conductuales y en la manipulación del prompt, no en acceso al mecanismo interno del modelo.
  • Las normas humanas se usan para escalar la magnitud, pero el estudio no recoge una nueva muestra humana paralela ni demuestra equivalencia psicométrica entre respuestas humanas y respuestas de modelos.
  • Los ítems invertidos pueden ocupar otra región semántica y cargar en factores distintos; su efecto no constituye una solución general ni aísla por completo el sesgo de aquiescencia.
  • La deseabilidad se operacionaliza por la dirección culturalmente valorada de los Big Five, no mediante una escala independiente de deseabilidad social aplicada en paralelo.
  • Aumentar Qn cambia simultáneamente la detectabilidad del test, la cantidad de contexto, la composición del lote y las oportunidades de consistencia local; la manipulación no aísla un único mecanismo.
  • La prueba de reconocimiento usa una regla léxica con términos como assessment, affect e inventory; no se publica validación humana de precisión, falsos positivos o sensibilidad del clasificador.
  • Las semillas del código ordenan preguntas, pero no fijan la aleatoriedad del endpoint; por ello las ejecuciones con temperatura mayor que cero no quedan reproducibles por seed de modelo.
  • El código de generación liberado contiene placeholders de credenciales con sintaxis inválida, `throw` no definido y un endpoint Groq hardcodeado que ignora el argumento de modelo.
  • requirements.txt solo declara openai, backoff y ratelimit, pero el pipeline usa también tenacity, groq, pandas, tqdm, scipy, numpy, matplotlib y seaborn, sin versiones ni lockfile.
  • La ruta de preprocesado imputa 3 cuando no extrae números y usa parsers distintos por proveedor; no se informa cuántas respuestas fueron imputadas ni se hace análisis de sensibilidad.
  • Figure 1A se genera desde constantes, incluidos los intervalos, en lugar de leer los datos; el origen y fórmula exacta de esas bandas no quedan documentados.
  • El agregado usado por las figuras combina cuatro temperaturas para Q1/Q5 pero solo temperatura 0 para Q10/Q20; usarlo sin filtrar confunde tamaño de lote y disponibilidad por temperatura.
  • El artículo declara N=30 y CI95% en Figure 1A, mientras el código de la figura fija bandas manuales compatibles con otro divisor y no documenta el cálculo inferencial.
  • No se libera el código que calcula alfa de Cronbach o la fiabilidad por mitades; las estimaciones no pueden reconstruirse desde el pipeline publicado sin implementar análisis adicional.
  • La función de t-test disponible supone muestras independientes de tamaño 30 para Q1 frente a otros lotes, aunque las condiciones comparten seeds de orden, y no está conectada a la creación de figuras.
  • No se documenta corrección por las múltiples comparaciones entre lotes y rasgos; la caption resume p<.001 sin exponer tabla, estadístico, grados de libertad o test principal.
  • El OSF no incluye README, licencia, manifiesto de ejecución, tests o CI que vinculen cada figura con archivos, filtros y commit concretos.
  • Los datos contienen modelos y condiciones adicionales no descritos en la lista principal y nombres de carpetas inconsistentes; esto dificulta separar material exploratorio del análisis reportado.
  • Las comparaciones con desviaciones estándar humanas convierten una diferencia de medias de outputs en unidades de otra población, pero no demuestran equivalencia de escala o de constructo.
  • Las afirmaciones de que modelos más grandes o recientes muestran más sesgo se basan en ocho endpoints heterogéneos y sin modelo estadístico causal de tamaño, fecha, proveedor o entrenamiento.
  • Solo se estudia un inventario Big Five en inglés; no se evalúan culturas, idiomas, escalas menos conocidas, tareas conductuales independientes ni interacción prolongada.

Qué no demuestra

  • No demuestra que los LLM tengan personalidad humana, autoconciencia ni una intención subjetiva de causar buena impresión.
  • No valida el uso general de LLM como sustitutos de participantes humanos ni que reproduzcan distribuciones psicológicas dentro de distintas culturas.
  • No demuestra que el tamaño, la fecha del modelo, los datos de entrenamiento o el ajuste por preferencias causen el sesgo observado.
  • No establece que invertir ítems elimine el problema ni que el efecto aparezca en cualquier cuestionario psicológico.
  • No identifica un mecanismo interno de awareness ni separa de forma causal reconocimiento léxico, consistencia contextual e instruction following.
  • No permite reproducir de extremo a extremo los intervalos, p-valores y estimaciones de fiabilidad con el código liberado sin correcciones y análisis adicionales.

Modelos evaluados

  • text-davinci-002
  • gpt-3.5-turbo-0613
  • gpt-4-0613
  • claude-3-haiku-20240229
  • claude-3-opus-20240229
  • chat-bison-001 (PaLM 2)
  • Llama 2 70B Chat
  • Llama 3 70B Instruct

Instrumentos y métricas

  • IPIP representation of the NEO-PI-R domains (100 items)
  • Five-point Likert response scale
  • Cronbach's alpha
  • Spearman–Brown corrected split-half reliability

Datos utilizados

  • OSF replication materials: osf.io/3fq2n
  • Human Big Five population norms reported by Hughes et al. (2021)

Evidencia y localización

  • Diseño, modelos, fechas, instrumento, prompts, codificación, orden y temperaturas: Supplementary Information, pp. 2–3, sections A–D.2
  • Magnitud del desplazamiento en GPT-4 y comparación entre familias: Main article, p. 2, Results and Figure 1
  • Reconocimiento del contexto, instrucción explícita y efecto de la codificación invertida: Main article, pp. 2–3, Driving mechanism for bias and Figure 2
  • Robustez y estimaciones de fiabilidad: Main article, p. 2, Robustness and Consistency and reliability
  • Alcance, cautelas y cuestiones no resueltas: Main article, pp. 3–4, Discussion
  • Código, prompts, parsers, archivos crudos y preprocesados: OSF osf.io/3fq2n, Code.zip and Data.zip audited 15 Jul 2026: 2,418 raw files and 3,263 preprocessed files
  • Reproducción de las medias GPT-4 y discrepancias de tamaño muestral: OSF Data.zip, GPT-4 gpt-4-0613 Temp0.0 META_META files and released combined_data.csv audited 15 Jul 2026
  • Generación manual de Figure 1A y pipeline inferencial incompleto: OSF Code.zip, radar_plots.py lines 4–93 and plotting_library.py lines 39–59, 407–415 and 620–651