El trabajo propone separar la persona dinámica de sus límites conductuales. El prompt del agente puede cambiar nombre, rasgos, expresiones, recuerdos y conversación reciente, mientras cada guardrail se almacena como un adaptador LoRA independiente sobre Llama-3.1-8B-Instruct cuantizado a 4 bits. A partir de una definición mínima de trigger y resolución, GPT-4o-mini-2024-07-18 genera contextos sintéticos y, para cada uno, una respuesta aceptada que cumple la regla y otra rechazada que realiza la conducta no deseada. El modelo se ajusta con ORPO, con lambda 0,1. El artículo prueba tres políticas: rechazar encuentros presenciales, negarse a hablar de cualquier tema político y rechazar opiniones expertas. Todas exigen además anteponer la marca literal <guard>.
Por cada guardrail se generan 200 tripletas de entrenamiento y 25 de validación. Un único juez LLM recibe la conducta esperada, el último mensaje y la respuesta, y devuelve validez y adherencia en JSON. El paper no identifica por separado la versión del juez; el único modelo auxiliar nombrado es GPT-4o-mini. También declara pruebas sobre 50 conversaciones y promedios de cinco ejecuciones, pero no aclara si esas ejecuciones son nuevas decodificaciones, nuevos tests o nuevos entrenamientos. No publica temperatura, semillas, tratamiento de fallos del juez ni intervalos. La evaluación usa conversaciones trigger y neutrales generadas dentro del mismo marco sintético que el entrenamiento.
Los adaptadores individuales obtienen 100,0% de adherencia juzgada para política y encuentros, y 96,0% para opinión experta, frente a 6,4%, 8,0% y 47,2% del modelo base. Las conversaciones neutrales se consideran no afectadas en 96,8%, 96,0% y 100,0%, aunque los autores observan cambios de tema políticos no solicitados. La etiqueta <guard> aparece en 100,0%, 100,0% y 92,0% de los triggers. Al fijar persona e historial, el guardrail político baja de 100,0% a 68,0%, lo que apoya que variar el contexto sintético mejora el ajuste dentro de este protocolo. Son tasas binarias sobre una muestra pequeña y parecida al entrenamiento, no medidas de seguridad general o de fidelidad de personaje.
La modularidad tiene un límite importante. Sumar linealmente los tres LoRA produce casi ninguna respuesta coherente que cumpla las reglas. Los autores recuperan parte del rendimiento aplicando SVD a la combinación y truncando a rango 16: 100,0% para encuentros, 80,8% para política y 82,4% para opinión experta. Esta mezcla debe calcularse previamente y se describe como demasiado costosa para combinación en tiempo real. No se prueban reglas contradictorias ni prioridades. En la comparación política, el adaptador marca 100,0% y Llama Guard 7,7%, pero las tareas no son equivalentes: el primero fue entrenado para censurar toda conversación política y generar una resolución, mientras Llama Guard es un clasificador general de contenido inseguro.
El circuito de evaluación es cerrado: las mismas reglas construyen los ejemplos positivos, negativos y la rúbrica del juez, y la marca <guard> puede actuar como atajo. No hay anotación humana formal, segundo juez, ataques adaptativos, jailbreaks, prompt injection, paráfrasis adversariales, otros idiomas, contexto largo, contaminación de memoria ni usuarios reales. Tampoco se miden utilidad, exceso de rechazo, capacidades generales, naturalidad o consistencia de persona; esta última depende de una inspección manual sin protocolo ni N. Rechazar toda política o toda consulta especializada es una decisión de producto, no una definición universal de seguridad. El único repositorio citado devuelve actualmente 404 y el paper remite allí los hiperparámetros completos. No están disponibles código, datos, pesos, outputs del juez o figuras. La evidencia sólida es un proof of concept in-distribution: 200 preferencias sintéticas pueden enseñar tres reglas explícitas a un modelo 8B. No demuestra alineamiento robusto, seguridad de producción ni guardrails combinables bajo demanda.