El trabajo estudia si la desalineación emergente tras una afinación estrecha se explica mejor como aprendizaje de respuestas erróneas o como adquisición de una disposición conductual persistente. Los autores llaman character a esa disposición interna hipotética y persona a su manifestación observable. Afinan por SFT Llama-3.1-8B-Instruct y Qwen2.5-14B-Instruct durante tres épocas con respuestas que GPT-5 genera para 6.000 consultas en cada uno de tres dominios, salud, carrera y mantenimiento del automóvil, bajo instrucciones Evil, Sycophantic o Hallucinatory. El comparador usa respuestas de consejo incorrecto sin etiqueta de carácter. Son categorías operacionales y moralizadas de comportamiento del modelo, no rasgos psicológicos humanos validados.
En la comparación Evil, Llama pasa de 0,22 a 34,63 en puntuación de desalineación y de 0,01 a 47,20 en Trait Expression Score frente a la afinación con consejo incorrecto. Qwen pasa de 17,05 a 45,22 y de 8,21 a 59,17. La caída media de MMLU es menor con Evil que con consejo incorrecto: -0,50 frente a -3,16 puntos para Llama y -0,25 frente a -5,74 para Qwen. Los tres patrones siguen apareciendo al afinar en un dominio y evaluar en los otros, aunque Evil suele expresarse menos que sycophancy y hallucination. Esto respalda que el contenido explícitamente orientado a una disposición puede producir un patrón de respuesta persistente y transferible en los dos modelos probados; MMLU por sí solo no demuestra conservación de todas las capacidades.
El estudio introduce además persona switch. Para cada patrón mezcla 500 ejemplos dañinos con trigger y 500 benignos sin trigger. Sin la señal, TES queda aproximadamente entre 0,01 y 3,56; con ella sube entre 49,66 y 94,40. En la evaluación de activación con trigger, el ASR es 89/58/82% para Evil/Sycophantic/Hallucinating en Llama y 95/44/88% en Qwen, manteniendo 92-97% de rechazo sin trigger. En 100 instrucciones dañinas, prompts de jailbreak alineados con cada disposición elevan el ASR de los modelos base, 0-1%, a 76/56/72% en Llama y 81/45/81% en Qwen afinados. Los prompts no están ofuscados, pero sí declaran marcos como superioridad, ausencia de límites éticos o infalibilidad; no equivalen a personas benignas ordinarias.
La parte denominada mechanistic proyecta activaciones de Qwen sobre vectores lineales de persona y observa valores mayores para ejemplos Evil, respuestas activadas por trigger y jailbreaks exitosos. Es evidencia correlacional: no se interviene sobre el vector, no se demuestra necesidad o suficiencia ni se descartan direcciones alternativas de contenido dañino, sentimiento o estilo. Tampoco se ajusta un modelo formal de variable latente ni se prueba identificabilidad. GPT-5 crea el comportamiento que se desea inducir y un único GPT-4.1-mini lo puntúa con una definición muy parecida; por eso TES funciona como comprobación de la manipulación, pero no valida de forma independiente un character interno. El baseline de consejo incorrecto también puede diferir en teacher, longitud, coherencia, léxico, estilo y grado de daño.
Toda la evaluación conductual depende de GPT-4.1-mini sin calibración humana, segundo juez ni fiabilidad entre anotadores. No se publican intervalos, contrastes, repeticiones de afinación, semillas ni varianza de decodificación a temperatura 1,0. TES excluye casos con menos de 0,25 de masa de probabilidad en enteros 0-100, pero no informa tokenización, excluidos ni sensibilidad. Tampoco consta N para varias figuras, splits completos o posible reutilización de consultas. No se localizaron código, datos generados, checkpoints, configuraciones, logs ni outputs del juez; faltan además learning rate exacto, optimizador, hardware, revisiones de modelo y detalles suficientes de los vectores. La contribución sólida es documentar una superficie de riesgo conductual condicionable en dos modelos. No establece carácter humano, intención, un mecanismo causal compartido ni una publicación revisada por pares: sigue siendo arXiv v1.