El estudio examina si instrucciones basadas en los niveles alto y bajo de los seis rasgos HEXACO cambian el sesgo, el sentimiento y la toxicidad de GPT-4o-mini, Llama 3.1 70B Instruct y Qwen 2.5 72B Instruct. Primero confirma que los modelos producen puntuaciones extremas esperadas en HEXACO-100 cuando reciben descripciones que ya enumeran las conductas correspondientes. Después compara una condición base y doce condiciones de rasgo en 29.246 preguntas ambiguas de BBQ, 3.014 prompts de BOLD y 1.199 prompts challenge de RealToxicityPrompts, con temperatura cero. En RealToxicityPrompts, alta amabilidad reduce la toxicidad media respecto de base de 13,2 a 6,4 en GPT-4o-mini, de 21,2 a 9,1 en Llama y de 26,1 a 10,6 en Qwen; baja amabilidad la eleva a 33,0, 31,8 y 36,7, y también incrementa fuertemente el sentimiento negativo. Alta honestidad-humildad, extraversión y apertura muestran patrones favorables en texto abierto, pero no todos los rasgos, modelos o tareas siguen el mismo patrón. En BBQ solo seis de 36 contrastes frente a base alcanzan p < 0,05 sin corrección por comparaciones múltiples: baja amabilidad es el único efecto nominalmente significativo en los tres modelos, mientras que alta amabilidad no lo es en ninguno. La evidencia más consistente es, por tanto, que una instrucción de baja amabilidad aumenta respuestas dañinas; la afirmación general de que configurar personalidad mitiga sesgo y toxicidad es más exploratoria. Además, los prompts no aíslan un rasgo latente: ordenan directamente perdonar o guardar rencor, controlar o expresar ira, evitar manipulación o romper reglas, de modo que el efecto puede proceder de esas instrucciones conductuales. VADER y Perspective API se contrastan con 780 anotaciones por métrica y alcanzan correlaciones agregadas con evaluación manual de 0,752 y 0,768. La robustez ante una reescritura de prompts y tres submuestras repetidas es alta. Sin embargo, el índice combinado Sopen se describe como 0–1 aunque su fórmula alcanza 1,5 y da doble peso al sentimiento; los evaluadores humanos pertenecen al equipo y no se informa acuerdo entre anotadores. Baja honestidad-humildad genera respuestas muy positivas por adulación, un caso que el propio artículo reconoce como falsa mitigación con riesgo de complacencia. El trabajo aporta evidencia causal sobre el efecto de instrucciones concretas en estos benchmarks, no sobre personalidad interna ni sobre una defensa de seguridad lista para producción.
Pregunta de investigación
¿Cómo cambian el sesgo en preguntas ambiguas y el sentimiento y la toxicidad del texto generado cuando tres LLM reciben descripciones de niveles altos o bajos de cada rasgo HEXACO, y pueden determinadas configuraciones reducir esos resultados sin degradar tareas generales?