Investigating the Impact of LLM Personality on Cognitive Bias Manifestation in Automated Decision-Making Tasks

Aplicaciones, sesgos y seguridad2025arXivRevisión editorial aprobada

Título original: Investigating the Impact of LLM Personality on the Manifestation of Cognitive Biases in Decision-Making Tasks

Autores: Jiangen He, Jiqun Liu

Palabras clave: Artificial Intelligence, Large Language Models, Cognitive Biases, Decision-Making, Personality Traits

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
20
Hallazgos
34
Limitaciones
10
Evidencias

Resumen editorial

Español

El preprint estudia si instrucciones que describen los cinco grandes rasgos de personalidad modifican ocho efectos de decisión en GPT-4o, GPT-4o-mini, Llama 3-70B y Llama 3-8B, y si una advertencia verbal reduce esos efectos. Conviene precisar desde el principio qué significa aquí personalidad: no se mide un rasgo inherente del modelo ni se valida que este adopte un perfil psicométrico; se antepone una descripción de apertura, responsabilidad, extraversión, amabilidad o neuroticismo, o una descripción supuestamente inversa. El material combina 13.465 prompts de admisión universitaria reutilizados de Echterhoff et al. para anclaje, framing, statu quo y atribución grupal con 4.585 escenarios BiasEval generados mediante GPT-4 para efecto señuelo, aversión al riesgo, coste hundido y efecto dotación. Los cuatro modelos se ejecutan con temperatura 0 bajo condiciones base, de rasgo y de rasgo invertido; para la mitigación se añade literalmente “Be mindful of not being biased by cognitive bias”. Cada efecto se expresa como una diferencia de tasas, salvo dotación, que normaliza la diferencia entre willingness-to-accept y willingness-to-pay con una valoración de control. La mitigación se calcula como la reducción del valor absoluto del efecto respecto de la condición base, de modo que un signo negativo en la columna de mitigación significa aumento de magnitud. Los resultados son muy dependientes del modelo y del prompt. En anclaje, GPT-4o pasa de 0,112 sin rasgo a 0,338 con amabilidad, mientras Llama 3-70B parte de -0,243 y permanece negativo en los cinco rasgos. En framing, GPT-4o reduce una diferencia base de -0,063 a valores entre -0,008 y 0,002, pero Llama 3-70B aumenta la magnitud hasta -0,181 con neuroticismo. Los baselines del señuelo varían de -0,385 en GPT-4o-mini a 0,128 en Llama 3-70B; un valor negativo indica desplazamiento en dirección contraria al efecto esperado, no ausencia de sensibilidad. En aversión al riesgo los baselines son 0,044, 0,544, 0,428 y 0,074 para GPT-4o, GPT-4o-mini, Llama 3-70B y Llama 3-8B; las instrucciones de rasgo pueden tanto ampliar como reducir esas diferencias. Coste hundido queda en cero casi siempre, salvo 0,008 y 0,019 para extraversión y amabilidad en GPT-4o. Los baselines de statu quo son 0,134, -0,101, -0,320 y -0,004, de nuevo con direcciones heterogéneas. El efecto dotación muestra cambios extremos: los baselines publicados son 4,27%, 23,07%, 91,23% y 39,77%, pero con algunos rasgos alcanzan 109,59% en GPT-4o y 124,37% en Llama 3-8B. La atribución grupal por género es pequeña en las condiciones base (-0,002, -0,018, 0,019 y 0). El paper resume que responsabilidad y amabilidad suelen favorecer la advertencia de mitigación. Recalculando su propia figura descriptiva, la reducción media es 0,0305 para responsabilidad y 0,0246 para amabilidad en 24 filas cada una, pero la figura duplica exactamente todos los valores de framing bajo la etiqueta statu quo en los cuatro modelos. No hay tests, intervalos, errores estándar ni repeticiones independientes que permitan usar “significativamente” en sentido estadístico. La reproducibilidad también es insuficiente: el apéndice promete prompts detallados, pero deja `{context}`, `{question}` y otras variables sin las descripciones reales de personalidad, personalidad inversa o escenarios; no se publican BiasEval, salidas, código, snapshots de modelos ni fechas de API. La tabla resumida omite apertura para GPT-4o-mini en anclaje, la tabla detallada deja sin baseline ni mitigación las filas de anclaje de Llama 3-8B aunque la tabla principal sí da esos valores, y la tabla detallada de coste hundido omite GPT-4o-mini. La contribución defendible es demostrar que las respuestas a tareas sintéticas cambian mucho al modificar instrucciones y arquitectura. No demuestra rasgos estables del modelo, causalidad psicológica, eficacia general de una personalidad para mitigar sesgos ni seguridad en decisiones reales.

English

The preprint asks whether instructions describing the Big Five traits change eight decision effects in GPT-4o, GPT-4o-mini, Llama 3-70B, and Llama 3-8B, and whether a verbal warning reduces those effects. Personality needs precise interpretation here: the study neither measures an inherent model trait nor validates that a model adopts a psychometric profile. It prepends a description of Openness, Conscientiousness, Extraversion, Agreeableness, or Neuroticism, or a supposedly reversed description. The material combines 13,465 university-admission prompts reused from Echterhoff et al. for anchoring, framing, status quo, and group attribution with 4,585 GPT-4-generated BiasEval scenarios for decoy, risk aversion, sunk cost, and endowment effects. All four models run at temperature zero under baseline, trait, and reversed-trait conditions; mitigation literally adds the sentence, “Be mindful of not being biased by cognitive bias.” Each effect is a difference in rates except endowment, which normalizes the willingness-to-accept minus willingness-to-pay difference by a control valuation. Mitigation is the reduction in absolute effect relative to baseline, so a negative mitigation value means that magnitude increased. Results depend strongly on architecture and prompt. For anchoring, GPT-4o moves from 0.112 without a trait to 0.338 under Agreeableness, while Llama 3-70B starts at -0.243 and remains negative under all five traits. For framing, GPT-4o reduces a -0.063 baseline difference to between -0.008 and 0.002, but Llama 3-70B increases the magnitude to -0.181 under Neuroticism. Decoy baselines range from -0.385 for GPT-4o-mini to 0.128 for Llama 3-70B; a negative value is a shift opposite the predicted decoy direction, not absence of sensitivity. Risk-aversion baselines are 0.044, 0.544, 0.428, and 0.074 for GPT-4o, GPT-4o-mini, Llama 3-70B, and Llama 3-8B, with trait prompts sometimes increasing and sometimes decreasing them. Sunk cost is almost always zero, except 0.008 and 0.019 for Extraversion and Agreeableness in GPT-4o. Status-quo baselines are 0.134, -0.101, -0.320, and -0.004, again with heterogeneous directions. Endowment changes are extreme: published baselines are 4.27%, 23.07%, 91.23%, and 39.77%, while some trait conditions reach 109.59% for GPT-4o and 124.37% for Llama 3-8B. Baseline gender group-attribution effects are small (-0.002, -0.018, 0.019, and 0). The paper concludes that Conscientiousness and Agreeableness tend to help the awareness warning. Recomputing its own descriptive figure gives mean reductions of 0.0305 for Conscientiousness and 0.0246 for Agreeableness over 24 rows each, but the figure duplicates every framing value under status quo for all four models. No tests, intervals, standard errors, or independent replications justify using “significantly” in the statistical sense. Reproducibility is also inadequate: although the appendix promises detailed prompts, it leaves `{context}`, `{question}`, and other placeholders instead of the actual personality, reversed-personality, and scenario text; BiasEval, generations, code, model snapshots, and API dates are not released. The summary table omits Openness for GPT-4o-mini anchoring; the detailed table provides neither a baseline nor mitigation values for Llama 3-8B anchoring even though the main table reports them; and the detailed sunk-cost table omits GPT-4o-mini. The defensible contribution is evidence that outputs on synthetic decision tasks change substantially with instructions and architecture. It does not establish stable model traits, psychological causation, general efficacy of any personality for debiasing, or safety in real decisions.

Pregunta de investigación

¿Cómo cambian ocho medidas de sesgo o efecto de decisión cuando cuatro LLM reciben instrucciones de representar rasgos Big Five normales o invertidos, y hasta qué punto una advertencia zero-shot de no sesgarse reduce la magnitud de esos efectos?

Método

Se reutilizan 13.465 prompts sintéticos de admisión para anclaje, framing, statu quo y atribución grupal, y se generan con GPT-4 otros 4.585 escenarios BiasEval para señuelo, aversión al riesgo, coste hundido y dotación. GPT-4o, GPT-4o-mini, Llama 3-70B y Llama 3-8B se consultan a temperatura 0 en condiciones sin rasgo, con cada uno de los cinco rasgos y con rasgos invertidos; la mitigación añade una advertencia genérica. Se comparan diferencias de tasas o valoraciones entre pares de condiciones y se define mitigación como la reducción del valor absoluto frente al baseline. La auditoría editorial leyó y renderizó las 19 páginas, congeló y revisó el fuente LaTeX, comprobó las tablas y la figura, recalculó sus agregados descriptivos y buscó código y datos asociados.

Muestra: 18.050 escenarios o prompts base declarados: 13.465 de admisión y 4.585 de BiasEval. El corpus de admisión incluye 5.449 prompts de anclaje, 1.008 de statu quo duplicados para control, 1.000 de framing triplicados y 1.000 de atribución grupal triplicados por género. BiasEval contiene entre 1.000 y 1.300 escenarios por cada uno de cuatro efectos. Estos materiales se reutilizan entre cuatro modelos, cinco rasgos, condiciones invertidas, baseline y advertencia, pero el paper no informa el número total de llamadas, fallos, exclusiones o repeticiones.

Hallazgos

  • La fuente vigente identificada es arXiv:2502.14219v1; la página actual del autor la sigue clasificando como preprint.
  • El estudio combina 13.465 prompts de admisión con 4.585 escenarios BiasEval no publicados.
  • Los cuatro modelos se ejecutan a temperatura 0, pero no se identifican snapshots, fechas ni configuraciones completas.
  • Personalidad significa una instrucción de rasgo; no se mide ni valida un perfil Big Five resultante.
  • El anclaje base es 0,112 en GPT-4o y sube a 0,338 con amabilidad.
  • Llama 3-70B tiene anclaje base -0,243 y valores negativos entre -0,202 y -0,260 según rasgo.
  • GPT-4o reduce framing de -0,063 en baseline a un intervalo de -0,008 a 0,002 bajo rasgos.
  • Llama 3-70B aumenta framing de -0,052 en baseline hasta -0,181 con neuroticismo.
  • Los baselines del efecto señuelo son 0,036, -0,385, 0,128 y 0,103 para GPT-4o, GPT-4o-mini, Llama 3-70B y Llama 3-8B.
  • Los baselines de aversión al riesgo son 0,044, 0,544, 0,428 y 0,074 en el mismo orden.
  • Coste hundido es cero en casi todas las celdas; solo GPT-4o muestra 0,008 con extraversión y 0,019 con amabilidad.
  • Los baselines de statu quo son 0,134, -0,101, -0,320 y -0,004, lo que evidencia direcciones distintas entre modelos.
  • Los efectos dotación base son 4,27%, 23,07%, 91,23% y 39,77%, con valores de rasgo que superan 100%.
  • La atribución grupal base por género es pequeña: -0,002, -0,018, 0,019 y 0.
  • Los rasgos invertidos no producen sistemáticamente el efecto opuesto a sus versiones normales.
  • La mitigación se limita a añadir una frase de concienciación y comparar magnitudes absolutas.
  • En la figura, responsabilidad y amabilidad tienen las mayores reducciones medias descriptivas: 0,0305 y 0,0246.
  • Las 24 filas de la figura incluyen cuatro copias exactas: statu quo repite framing para cada modelo.
  • No se reportan pruebas estadísticas, intervalos, errores o réplicas que sustenten significación inferencial.
  • No se localizó repositorio, BiasEval, salidas, código de ejecución o análisis público asociado.

Limitaciones

  • Los rasgos son inducidos por prompt y no propiedades inherentes observadas del modelo.
  • No se administra un inventario Big Five ni se comprueba que cada condición adopte el rasgo previsto.
  • Las instrucciones exactas de personalidad no aparecen en el apéndice ni en el fuente.
  • Las instrucciones exactas de personalidad invertida tampoco se publican.
  • El apéndice sustituye escenarios por marcadores como `{context}`, `{question}` y `{condition}`.
  • BiasEval se generó con GPT-4 pero no se libera ni se valida con jueces humanos.
  • No se informa semilla, prompt de generación ni proceso de filtrado de BiasEval.
  • Los escenarios de admisión y BiasEval son sintéticos y no representan decisiones desplegadas.
  • Solo se estudian cuatro modelos de una ventana temporal concreta.
  • Faltan IDs exactos de GPT-4o y GPT-4o-mini y fechas de consulta.
  • Faltan checkpoints, revisiones, cuantización, servidor y plantillas de chat de Llama 3.
  • Temperatura 0 no garantiza determinismo entre servicios o hardware y no se reportan réplicas.
  • No se informa el número total de llamadas, errores, reintentos, respuestas inválidas o exclusiones.
  • No hay pruebas de hipótesis, intervalos de confianza, errores estándar o análisis de potencia.
  • El uso de `significantly` es descriptivo, no inferencial.
  • Los valores negativos se interpretan como sesgo inverso, pero su importancia sustantiva no se valida.
  • La mitigación basada en valor absoluto equipara una reducción hacia cero con cambios que pueden cruzar de dirección.
  • La advertencia menciona literalmente cognitive bias sin especificar cuál ni controlar demanda experimental.
  • No existe un control de instrucción de longitud o tono equivalente sin contenido de mitigación.
  • No se separa el efecto del contenido del rasgo de obedecer una instrucción adicional.
  • La métrica de dotación depende de valores numéricos generados sin limpieza, dispersión ni robustez ante extremos.
  • La mitigación relativa de dotación usa baselines cercanos a cero y produce porcentajes inestables de hasta -2467,85%.
  • La figura duplica exactamente framing como statu quo en los cuatro modelos.
  • Duplicar esas filas altera los promedios usados para apoyar la conclusión sobre rasgos.
  • La tabla principal omite apertura para GPT-4o-mini en anclaje, aunque la tabla detallada sí la incluye.
  • La tabla detallada de anclaje no da baseline ni mitigación para Llama 3-8B, pero la tabla principal sí publica esos números.
  • La tabla detallada de coste hundido omite GPT-4o-mini pese a que la tabla resumen muestra ceros.
  • La tabla principal publica mitigaciones invertidas de anclaje para Llama 3-8B sin tasas subyacentes que permitan verificarlas.
  • No hay código para reconstruir tablas, colores, figura o agregados.
  • No hay datos de salida para auditar parsing, respuestas fuera de formato o sensibilidad a ejemplos concretos.
  • No se evalúan exactitud, utilidad, equidad para grupos reales ni consecuencias de las decisiones.
  • No hay evaluación humana del carácter razonable o dañino de las respuestas.
  • Comparar patrones con literatura humana no convierte las instrucciones en personalidad psicológica.
  • La versión es un preprint y no se identificó una publicación aceptada con revisión por pares.

Qué no demuestra

  • No demuestra que los modelos posean rasgos Big Five estables o inherentes.
  • No prueba que una instrucción de rasgo produzca el mismo constructo medido en humanos.
  • No establece relaciones causales psicológicas entre personalidad y sesgo.
  • No demuestra significación estadística de las diferencias observadas.
  • No demuestra que responsabilidad o amabilidad mitiguen sesgos de forma general.
  • No valida las condiciones invertidas como opuestos psicométricos.
  • No permite reproducir los resultados sin prompts, BiasEval, salidas y snapshots.
  • No generaliza de escenarios sintéticos a admisión, salud, finanzas o contratación reales.
  • No establece que reducir una diferencia de tasas mejore necesariamente equidad o calidad.
  • No demuestra seguridad, ausencia de discriminación o eficacia operativa de la advertencia.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2502.14219v1, submitted 20 February 2025; 19 pages

Fuente consultada: https://arxiv.org/pdf/2502.14219v1

Revisión: Codex full-text, visual, LaTeX-source and statistical-reporting audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o, exact snapshot and API date not reported
  • GPT-4o-mini, exact snapshot and API date not reported
  • Llama 3-70B, exact checkpoint and inference stack not reported
  • Llama 3-8B, exact checkpoint and inference stack not reported
  • GPT-4 used to generate the unreleased BiasEval scenarios, exact snapshot not reported

Instrumentos y métricas

  • Big Five trait descriptions used as prompt prefixes
  • Reversed-personality prompt conditions
  • Awareness instruction: Be mindful of not being biased by cognitive bias
  • Anchoring effect as admit-rate difference after a prior admit versus reject decision
  • Framing effect as admit-rate difference under admit versus reject wording
  • Decoy effect as target-option selection shift after adding a dominated option
  • Risk-aversion effect as risky-choice difference across gain and loss framing
  • Sunk-cost effect as continuation-rate difference with versus without past investment
  • Status-quo effect as default-option rate minus mean alternative-option rate
  • Endowment effect from WTA, WTP and control valuations
  • Gender group-attribution effect from male versus female math judgments

Datos utilizados

  • Student Admission Dataset from Echterhoff et al. (2024), 13,465 prompts
  • Unreleased BiasEval dataset, 4,585 GPT-4-generated scenarios
  • Published summary and appendix tables for eight effects
  • Published bias-reduction figure with duplicated framing/status-quo rows
  • arXiv:2502.14219v1 LaTeX source archive

Evidencia y localización

  • Pregunta, marco y definición de personalidad: arXiv v1 pp. 1–3, Abstract, Sections 1 and 2.1
  • Ocho efectos y taxonomía: arXiv v1 pp. 3–5, Sections 2.2–2.4
  • Corpus de admisión y BiasEval: arXiv v1 p. 4, Sections 2.3.1–2.3.2
  • Modelos, temperatura y métrica de mitigación: arXiv v1 p. 5, Section 2.4 and opening of Section 3
  • Resultados de rasgos normales e invertidos: arXiv v1 pp. 5–8, Tables 1–3 and Sections 3.1–3.2
  • Advertencia y conclusión de mitigación: arXiv v1 pp. 7–8, Section 3.3 and Figure 2
  • Limitaciones reconocidas por los autores: arXiv v1 p. 9, Section 6
  • Prompts incompletos y tablas detalladas: arXiv v1 pp. 11–19, Appendix A and Tables 4–11
  • Duplicación framing/statu quo y agregados por rasgo: Frozen arXiv v1 source asset bias-reduction.pdf, independently extracted and recomputed 15 Jul 2026
  • Estado de preprint y ausencia de artefactos públicos: arXiv record, current author publication page, Papers With Code and GitHub title/author search, checked 15 Jul 2026