El preprint estudia si instrucciones que describen los cinco grandes rasgos de personalidad modifican ocho efectos de decisión en GPT-4o, GPT-4o-mini, Llama 3-70B y Llama 3-8B, y si una advertencia verbal reduce esos efectos. Conviene precisar desde el principio qué significa aquí personalidad: no se mide un rasgo inherente del modelo ni se valida que este adopte un perfil psicométrico; se antepone una descripción de apertura, responsabilidad, extraversión, amabilidad o neuroticismo, o una descripción supuestamente inversa. El material combina 13.465 prompts de admisión universitaria reutilizados de Echterhoff et al. para anclaje, framing, statu quo y atribución grupal con 4.585 escenarios BiasEval generados mediante GPT-4 para efecto señuelo, aversión al riesgo, coste hundido y efecto dotación. Los cuatro modelos se ejecutan con temperatura 0 bajo condiciones base, de rasgo y de rasgo invertido; para la mitigación se añade literalmente “Be mindful of not being biased by cognitive bias”. Cada efecto se expresa como una diferencia de tasas, salvo dotación, que normaliza la diferencia entre willingness-to-accept y willingness-to-pay con una valoración de control. La mitigación se calcula como la reducción del valor absoluto del efecto respecto de la condición base, de modo que un signo negativo en la columna de mitigación significa aumento de magnitud. Los resultados son muy dependientes del modelo y del prompt. En anclaje, GPT-4o pasa de 0,112 sin rasgo a 0,338 con amabilidad, mientras Llama 3-70B parte de -0,243 y permanece negativo en los cinco rasgos. En framing, GPT-4o reduce una diferencia base de -0,063 a valores entre -0,008 y 0,002, pero Llama 3-70B aumenta la magnitud hasta -0,181 con neuroticismo. Los baselines del señuelo varían de -0,385 en GPT-4o-mini a 0,128 en Llama 3-70B; un valor negativo indica desplazamiento en dirección contraria al efecto esperado, no ausencia de sensibilidad. En aversión al riesgo los baselines son 0,044, 0,544, 0,428 y 0,074 para GPT-4o, GPT-4o-mini, Llama 3-70B y Llama 3-8B; las instrucciones de rasgo pueden tanto ampliar como reducir esas diferencias. Coste hundido queda en cero casi siempre, salvo 0,008 y 0,019 para extraversión y amabilidad en GPT-4o. Los baselines de statu quo son 0,134, -0,101, -0,320 y -0,004, de nuevo con direcciones heterogéneas. El efecto dotación muestra cambios extremos: los baselines publicados son 4,27%, 23,07%, 91,23% y 39,77%, pero con algunos rasgos alcanzan 109,59% en GPT-4o y 124,37% en Llama 3-8B. La atribución grupal por género es pequeña en las condiciones base (-0,002, -0,018, 0,019 y 0). El paper resume que responsabilidad y amabilidad suelen favorecer la advertencia de mitigación. Recalculando su propia figura descriptiva, la reducción media es 0,0305 para responsabilidad y 0,0246 para amabilidad en 24 filas cada una, pero la figura duplica exactamente todos los valores de framing bajo la etiqueta statu quo en los cuatro modelos. No hay tests, intervalos, errores estándar ni repeticiones independientes que permitan usar “significativamente” en sentido estadístico. La reproducibilidad también es insuficiente: el apéndice promete prompts detallados, pero deja `{context}`, `{question}` y otras variables sin las descripciones reales de personalidad, personalidad inversa o escenarios; no se publican BiasEval, salidas, código, snapshots de modelos ni fechas de API. La tabla resumida omite apertura para GPT-4o-mini en anclaje, la tabla detallada deja sin baseline ni mitigación las filas de anclaje de Llama 3-8B aunque la tabla principal sí da esos valores, y la tabla detallada de coste hundido omite GPT-4o-mini. La contribución defendible es demostrar que las respuestas a tareas sintéticas cambian mucho al modificar instrucciones y arquitectura. No demuestra rasgos estables del modelo, causalidad psicológica, eficacia general de una personalidad para mitigar sesgos ni seguridad en decisiones reales.
Pregunta de investigación
¿Cómo cambian ocho medidas de sesgo o efecto de decisión cuando cuatro LLM reciben instrucciones de representar rasgos Big Five normales o invertidos, y hasta qué punto una advertencia zero-shot de no sesgarse reduce la magnitud de esos efectos?