Exploring the Impact of Personality Traits on LLM Bias and Toxicity

Aplicaciones, sesgos y seguridad2025ACL AnthologyRevisión editorial aprobada

Autores: Shuo Wang, Renhao Li, Xi Chen, Yulin Yuan, Min Yang, Derek F. Wong

Palabras clave: Artificial Intelligence, Large Language Models, Personality Traits, Bias, Toxicity

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
9
Hallazgos
11
Limitaciones
11
Evidencias

Resumen editorial

Español

El estudio examina si instrucciones basadas en los niveles alto y bajo de los seis rasgos HEXACO cambian el sesgo, el sentimiento y la toxicidad de GPT-4o-mini, Llama 3.1 70B Instruct y Qwen 2.5 72B Instruct. Primero confirma que los modelos producen puntuaciones extremas esperadas en HEXACO-100 cuando reciben descripciones que ya enumeran las conductas correspondientes. Después compara una condición base y doce condiciones de rasgo en 29.246 preguntas ambiguas de BBQ, 3.014 prompts de BOLD y 1.199 prompts challenge de RealToxicityPrompts, con temperatura cero. En RealToxicityPrompts, alta amabilidad reduce la toxicidad media respecto de base de 13,2 a 6,4 en GPT-4o-mini, de 21,2 a 9,1 en Llama y de 26,1 a 10,6 en Qwen; baja amabilidad la eleva a 33,0, 31,8 y 36,7, y también incrementa fuertemente el sentimiento negativo. Alta honestidad-humildad, extraversión y apertura muestran patrones favorables en texto abierto, pero no todos los rasgos, modelos o tareas siguen el mismo patrón. En BBQ solo seis de 36 contrastes frente a base alcanzan p < 0,05 sin corrección por comparaciones múltiples: baja amabilidad es el único efecto nominalmente significativo en los tres modelos, mientras que alta amabilidad no lo es en ninguno. La evidencia más consistente es, por tanto, que una instrucción de baja amabilidad aumenta respuestas dañinas; la afirmación general de que configurar personalidad mitiga sesgo y toxicidad es más exploratoria. Además, los prompts no aíslan un rasgo latente: ordenan directamente perdonar o guardar rencor, controlar o expresar ira, evitar manipulación o romper reglas, de modo que el efecto puede proceder de esas instrucciones conductuales. VADER y Perspective API se contrastan con 780 anotaciones por métrica y alcanzan correlaciones agregadas con evaluación manual de 0,752 y 0,768. La robustez ante una reescritura de prompts y tres submuestras repetidas es alta. Sin embargo, el índice combinado Sopen se describe como 0–1 aunque su fórmula alcanza 1,5 y da doble peso al sentimiento; los evaluadores humanos pertenecen al equipo y no se informa acuerdo entre anotadores. Baja honestidad-humildad genera respuestas muy positivas por adulación, un caso que el propio artículo reconoce como falsa mitigación con riesgo de complacencia. El trabajo aporta evidencia causal sobre el efecto de instrucciones concretas en estos benchmarks, no sobre personalidad interna ni sobre una defensa de seguridad lista para producción.

English

The study tests whether instructions based on high and low levels of the six HEXACO traits change bias, sentiment, and toxicity in GPT-4o-mini, Llama 3.1 70B Instruct, and Qwen 2.5 72B Instruct. It first confirms that models produce the expected extreme HEXACO-100 scores after receiving descriptions that already enumerate the corresponding behaviors. It then compares a base condition with twelve trait conditions on 29,246 ambiguous BBQ questions, 3,014 BOLD prompts, and 1,199 challenge prompts from RealToxicityPrompts, using temperature zero. On RealToxicityPrompts, high Agreeableness reduces mean toxicity relative to base from 13.2 to 6.4 for GPT-4o-mini, 21.2 to 9.1 for Llama, and 26.1 to 10.6 for Qwen; low Agreeableness raises it to 33.0, 31.8, and 36.7 and also sharply increases negative sentiment. High Honesty-Humility, Extraversion, and Openness show favorable patterns in open-ended text, but not every trait, model, or task follows the same pattern. On BBQ, only six of 36 comparisons against base reach p < .05 without multiple-comparison correction: low Agreeableness is the only nominally significant effect in all three models, while high Agreeableness is not significant in any. The strongest evidence is therefore that a low-Agreeableness instruction increases harmful responses; the broader claim that personality configuration mitigates bias and toxicity remains exploratory. The prompts also do not isolate a latent trait: they directly instruct models to forgive or hold grudges, control or express anger, avoid manipulation or break rules, so effects may arise from those behavioral directives. VADER and Perspective API are checked against 780 annotations per metric and reach aggregate correlations with manual ratings of .752 and .768. Robustness to one prompt rewrite and three repeated subsamples is high. However, the combined Sopen index is described as ranging from zero to one even though its formula can reach 1.5 and weights sentiment twice; human raters are members of the research team and inter-rater agreement is not reported. Low Honesty-Humility yields highly positive text through excessive flattery, which the paper itself recognizes as apparent mitigation carrying sycophancy risk. The work provides causal evidence about specific instructions on these benchmarks, not about internal personality or a production-ready safety defense.

Pregunta de investigación

¿Cómo cambian el sesgo en preguntas ambiguas y el sentimiento y la toxicidad del texto generado cuando tres LLM reciben descripciones de niveles altos o bajos de cada rasgo HEXACO, y pueden determinadas configuraciones reducir esos resultados sin degradar tareas generales?

Método

Experimento factorial de prompting con una condición base y doce condiciones, una alta y una baja para cada rasgo HEXACO. Los autores verifican la manipulación con HEXACO-100 y ejecutan los tres modelos a temperatura 0 sobre BBQ-Ambiguous, BOLD y la partición challenge de RealToxicityPrompts. BBQ se evalúa con el bias score firmado y t-tests pareados sobre sus once categorías; BOLD y RealToxicityPrompts con proporciones VADER positivas/negativas, Perspective API y un índice combinado. Una submuestra de 780 salidas por métrica se reevalúa manualmente y con GPT-4.1-mini. La robustez se estudia reescribiendo prompts con GPT-4.5 y repitiendo tres veces submuestras de 1.000 ejemplos; MMLU College y Gigaword sirven como controles de rendimiento general.

Muestra: Tres modelos, trece condiciones por modelo y ejecución determinista a temperatura 0. BBQ aporta 29.246 preguntas ambiguas en once categorías; BOLD, 3.014 prompts equilibrados entre cinco dominios y subgrupos; y RealToxicityPrompts, 1.199 prompts de su partición challenge. La validación automática usa 780 salidas para sentimiento y otras 780 para toxicidad, equilibradas por rasgo y modelo. Los anotadores son miembros voluntarios del equipo, con formación de posgrado y residentes en China, pero no se informa cuántos participaron.

Hallazgos

  • Los prompts llevan las puntuaciones HEXACO-100 del rasgo solicitado aproximadamente a 4,38–5,00 en condiciones altas y a 1,00–1,69 en condiciones bajas, lo que confirma seguimiento de la instrucción, aunque no independencia ni validez psicométrica del constructo.
  • En BBQ, baja amabilidad eleva el bias score medio a 3,39 en GPT-4o-mini, 6,41 en Llama y 1,85 en Qwen, frente a bases de 1,55, 1,50 y −0,07; es el único contraste nominalmente significativo en los tres modelos, con p = 0,020, 0,001 y 0,039.
  • Solo seis de los 36 t-tests BBQ tienen p < 0,05 sin ajuste: cuatro corresponden a GPT-4o-mini y uno adicional a cada modelo abierto. Alta amabilidad obtiene p = 0,068, 0,919 y 0,413, por lo que su supuesta mitigación no está apoyada estadísticamente en esa tarea.
  • En BOLD, baja amabilidad eleva la proporción negativa media en 24,60 puntos y la toxicidad hasta 4,5, 15,3 y 10,1; alta amabilidad la mantiene en 2,2, 2,7 y 2,8. Las diferencias de toxicidad se describen como no significativas y generalmente inferiores a un punto para los rasgos altos.
  • En RealToxicityPrompts, alta amabilidad reduce la toxicidad en 6,8, 12,1 y 15,5 puntos respecto de base, mientras baja amabilidad la aumenta en 19,8, 10,6 y 10,6. Alta honestidad-humildad, extraversión y apertura también muestran reducciones descriptivas consistentes.
  • Baja honestidad-humildad aumenta las respuestas positivas en BOLD hasta 92,0 %, 94,4 % y 85,8 %, pero lo hace mediante adulación excesiva; el caso cualitativo muestra que menor negatividad automática puede ocultar complacencia y falta de sinceridad.
  • Perspective API y VADER correlacionan con los promedios manuales r = 0,768 y r = 0,752; GPT-4.1-mini alcanza 0,623 y 0,633. Son asociaciones razonables, pero no equivalencia con evaluación humana.
  • La reescritura de los prompts alcanza 96,8 % de acuerdo en BBQ y correlaciones de 0,90–0,99 en texto abierto; tres repeticiones sobre submuestras también fluctúan poco. Esto respalda estabilidad ante esa reescritura concreta y ese muestreo.
  • La variación máxima media es pequeña en MMLU College y Gigaword, pero algunas condiciones no son triviales: en Llama, baja honestidad-humildad reduce ROUGE-1 de 0,312 en base a 0,251.

Limitaciones

  • Los prompts contienen directamente conductas con valencia de seguridad: baja amabilidad ordena guardar rencor, criticar y enfadarse, y baja honestidad-humildad ordena adular y romper reglas. El diseño no separa un efecto de personalidad de un efecto semántico directo de la instrucción.
  • La verificación HEXACO reutiliza descripciones derivadas del propio instrumento; obtener extremos esperados demuestra obediencia al prompt, no fiabilidad, validez convergente, invariancia ni una personalidad estable.
  • Los 36 t-tests BBQ no tienen corrección por multiplicidad, intervalos de confianza ni tamaños de efecto. Tratar once categorías heterogéneas agregadas como pares limita la inferencia y los promedios firmados pueden cancelar sesgo estereotípico y contraestereotípico.
  • Para BOLD y RealToxicityPrompts se usan expresiones como significativo o efectivo sin presentar pruebas inferenciales por rasgo y modelo; las tablas son principalmente comparaciones descriptivas.
  • El índice Sopen suma proporción positiva, complemento de proporción negativa y complemento de toxicidad, y divide entre dos. Su rango teórico es 0–1,5, no 0–1, y da dos componentes al sentimiento frente a uno a toxicidad; por tanto, la comparación compacta de la Figura 3 depende de una ponderación discutible.
  • VADER es léxico y Perspective API puede tener sesgos de dominio o identidad. Las correlaciones de validación se calculan sobre trece promedios de condición y no se dan intervalos de confianza; un texto positivo tampoco equivale necesariamente a uno seguro o veraz.
  • Los anotadores pertenecen al equipo investigador, conocen las definiciones de los evaluadores automáticos y no se informa su número, acuerdo interanotador, resolución de discrepancias ni evaluación externa independiente.
  • Solo se estudian tres modelos, en inglés, con una instantánea propietaria y dos modelos de 70–72B. No se cubren sistemas pequeños, otros idiomas, diálogos prolongados, actualizaciones de modelos ni efectos en usuarios.
  • No se publican código, salidas, IDs de las muestras, semillas, versiones de librerías ni configuración completa de inferencia. El checklist oficial marca presupuesto, infraestructura y licencias como descritos, pero las secciones citadas no aportan esos detalles, por lo que el experimento no puede reproducirse de extremo a extremo.
  • La reescritura de robustez procede de un único modelo y las repeticiones usan submuestras de 1.000; no prueban robustez ante cambios sustanciales de formulación, contexto conversacional o ataques adaptativos.
  • La similitud cualitativa con correlaciones psicológicas humanas procede de literatura previa y no de una muestra humana paralela sometida a las mismas tareas.

Qué no demuestra

  • No demuestra que los modelos posean rasgos HEXACO, personalidad interna, emociones, valores morales ni una identidad persistente.
  • No demuestra que alta amabilidad u otro rasgo reduzca universalmente sesgo y toxicidad: los efectos dependen de tarea, métrica y modelo, y gran parte de los contrastes BBQ no es significativa.
  • No permite atribuir los cambios a un constructo psicológico separado de las instrucciones conductuales explícitas contenidas en el prompt.
  • No valida el índice Sopen como medida de seguridad ni prueba que sentimiento positivo sea beneficioso; la adulación de baja honestidad-humildad muestra el caso contrario.
  • No establece reducción de daño para usuarios, seguridad en conversaciones reales, resistencia a jailbreaks, equidad distributiva ni ausencia de nuevos sesgos.
  • No demuestra equivalencia entre los patrones de los LLM y las relaciones personalidad-conducta humanas; solo observa una correspondencia cualitativa con estudios anteriores.
  • No presenta una intervención lista para producción ni compara el prompting de rasgos con guardrails, clasificadores, fine-tuning de seguridad u otros controles.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2502.12566v3 (18 Sep 2025); EMNLP 2025 proceedings version, DOI 10.18653/v1/2025.emnlp-main.206, also reviewed

Fuente consultada: https://arxiv.org/pdf/2502.12566

Revisión: Codex editorial review and methods audit, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • GPT-4o-mini-2024-07-18
  • Llama-3.1-70B-Instruct
  • Qwen2.5-72B-Instruct
  • GPT-4.1-mini (evaluation judge)
  • GPT-4.5 (prompt rewriting for robustness)

Instrumentos y métricas

  • HEXACO-100-English
  • BBQ bias score in ambiguous contexts
  • VADER sentiment score
  • Perspective API toxicity probability
  • Paired t-tests across BBQ bias categories
  • Manual sentiment and toxicity ratings
  • ROUGE-1, ROUGE-2 and ROUGE-L

Datos utilizados

  • BBQ-Ambiguous
  • BOLD
  • RealToxicityPrompts challenge subset
  • MMLU college-level multiple-choice subsets
  • English Gigaword headline summarization

Evidencia y localización

  • Publicación, autoría, DOI y versión definitiva: ACL Anthology 2025.emnlp-main.206 and EMNLP 2025 proceedings PDF, pp. 4125–4143
  • Modelos, temperatura y validación de la manipulación HEXACO: Paper, pp. 4127–4129, sections 3.1 and 4.1, Figure 2
  • Datasets, tamaños de muestra y definiciones de métricas: Paper, pp. 4127–4128, sections 3.2–3.3, Equations 1–2
  • Resultados BBQ y significación por rasgo y modelo: Paper, pp. 4129–4130 and 4139, section 4.2, Tables 1 and 9
  • Resultados BOLD y RealToxicityPrompts: Paper, pp. 4130–4131, sections 4.3–4.4, Tables 2–3
  • Validación humana y automática de sentimiento y toxicidad: Paper, pp. 4131–4132 and 4143, section 4.5, Table 4 and Appendix G/Table 15
  • Adulación en baja honestidad-humildad y límites de una aparente mitigación: Paper, pp. 4132–4133, section 4.6, Table 5 and Discussion
  • Robustez ante reescritura y repetición: Paper, p. 4136, Appendix D
  • Rendimiento en tareas generales y posibles trade-offs: Paper, pp. 4136 and 4143, Appendix E, Tables 13–14
  • Limitaciones declaradas y conclusión de mitigación: Paper, p. 4133, sections 5–6 and Limitations
  • Declaraciones de reproducibilidad, artefactos y anotación: EMNLP 2025 Responsible NLP Checklist attachment for 2025.emnlp-main.206, pp. 1–2, checked against the cited paper sections