Behavioral Guardrails for Dynamic LLM Persona

Inducción y control de rasgos2025MIT PressRevisión editorial aprobada

Autores: Ognjen Malkoc, Koyuki Abe, Kazuki Kitagawa, Mizuki Oka, Yuya Ishikawa

Palabras clave: Large Language Models, Personality Control, Prompting, Persona, Steering

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
8
Hallazgos
18
Limitaciones
4
Evidencias

Resumen editorial

Español

El trabajo propone separar la persona dinámica de sus límites conductuales. El prompt del agente puede cambiar nombre, rasgos, expresiones, recuerdos y conversación reciente, mientras cada guardrail se almacena como un adaptador LoRA independiente sobre Llama-3.1-8B-Instruct cuantizado a 4 bits. A partir de una definición mínima de trigger y resolución, GPT-4o-mini-2024-07-18 genera contextos sintéticos y, para cada uno, una respuesta aceptada que cumple la regla y otra rechazada que realiza la conducta no deseada. El modelo se ajusta con ORPO, con lambda 0,1. El artículo prueba tres políticas: rechazar encuentros presenciales, negarse a hablar de cualquier tema político y rechazar opiniones expertas. Todas exigen además anteponer la marca literal <guard>.

Por cada guardrail se generan 200 tripletas de entrenamiento y 25 de validación. Un único juez LLM recibe la conducta esperada, el último mensaje y la respuesta, y devuelve validez y adherencia en JSON. El paper no identifica por separado la versión del juez; el único modelo auxiliar nombrado es GPT-4o-mini. También declara pruebas sobre 50 conversaciones y promedios de cinco ejecuciones, pero no aclara si esas ejecuciones son nuevas decodificaciones, nuevos tests o nuevos entrenamientos. No publica temperatura, semillas, tratamiento de fallos del juez ni intervalos. La evaluación usa conversaciones trigger y neutrales generadas dentro del mismo marco sintético que el entrenamiento.

Los adaptadores individuales obtienen 100,0% de adherencia juzgada para política y encuentros, y 96,0% para opinión experta, frente a 6,4%, 8,0% y 47,2% del modelo base. Las conversaciones neutrales se consideran no afectadas en 96,8%, 96,0% y 100,0%, aunque los autores observan cambios de tema políticos no solicitados. La etiqueta <guard> aparece en 100,0%, 100,0% y 92,0% de los triggers. Al fijar persona e historial, el guardrail político baja de 100,0% a 68,0%, lo que apoya que variar el contexto sintético mejora el ajuste dentro de este protocolo. Son tasas binarias sobre una muestra pequeña y parecida al entrenamiento, no medidas de seguridad general o de fidelidad de personaje.

La modularidad tiene un límite importante. Sumar linealmente los tres LoRA produce casi ninguna respuesta coherente que cumpla las reglas. Los autores recuperan parte del rendimiento aplicando SVD a la combinación y truncando a rango 16: 100,0% para encuentros, 80,8% para política y 82,4% para opinión experta. Esta mezcla debe calcularse previamente y se describe como demasiado costosa para combinación en tiempo real. No se prueban reglas contradictorias ni prioridades. En la comparación política, el adaptador marca 100,0% y Llama Guard 7,7%, pero las tareas no son equivalentes: el primero fue entrenado para censurar toda conversación política y generar una resolución, mientras Llama Guard es un clasificador general de contenido inseguro.

El circuito de evaluación es cerrado: las mismas reglas construyen los ejemplos positivos, negativos y la rúbrica del juez, y la marca <guard> puede actuar como atajo. No hay anotación humana formal, segundo juez, ataques adaptativos, jailbreaks, prompt injection, paráfrasis adversariales, otros idiomas, contexto largo, contaminación de memoria ni usuarios reales. Tampoco se miden utilidad, exceso de rechazo, capacidades generales, naturalidad o consistencia de persona; esta última depende de una inspección manual sin protocolo ni N. Rechazar toda política o toda consulta especializada es una decisión de producto, no una definición universal de seguridad. El único repositorio citado devuelve actualmente 404 y el paper remite allí los hiperparámetros completos. No están disponibles código, datos, pesos, outputs del juez o figuras. La evidencia sólida es un proof of concept in-distribution: 200 preferencias sintéticas pueden enseñar tres reglas explícitas a un modelo 8B. No demuestra alineamiento robusto, seguridad de producción ni guardrails combinables bajo demanda.

English

The paper separates a dynamic persona from its behavioral limits. The agent prompt may change name, traits, expressions, memories, and recent dialogue, while each guardrail is stored as a separate LoRA adapter on a 4-bit Llama-3.1-8B-Instruct model. Given a minimal trigger and resolution definition, GPT-4o-mini-2024-07-18 generates synthetic contexts and, for each one, an accepted answer that follows the rule and a rejected answer that performs the unwanted behavior. The target model is tuned with ORPO at lambda 0.1. Three policies are tested: reject in-person meetings, refuse every political discussion, and refuse expert opinions. Every policy also requires a literal <guard> prefix.

Each guardrail receives 200 training triplets and 25 validation triplets. A single LLM judge receives the expected behavior, last user message, and response and returns validity and adherence as JSON. The paper does not identify the judge version separately; GPT-4o-mini is the only named auxiliary model. It also reports tests on 50 conversations and averages across five runs, but does not say whether those runs are new decodes, test sets, or training runs. Temperature, seeds, judge-failure handling, and intervals are absent. Triggering and neutral evaluation conversations are generated within the same synthetic framework as training.

Single adapters receive 100.0% judged adherence for politics and meetings and 96.0% for expert opinion, versus 6.4%, 8.0%, and 47.2% for the base model. Neutral conversations are judged unaffected in 96.8%, 96.0%, and 100.0%, although the authors observe unprompted politics-related topic changes. The <guard> tag appears on 100.0%, 100.0%, and 92.0% of triggering cases. Holding persona and history fixed lowers the politics guardrail from 100.0% to 68.0%, supporting the value of varied synthetic context within this protocol. These are binary rates on a small, training-like sample, not measures of general safety or character fidelity.

Modularity has a material limit. Directly adding the three LoRAs produces almost no coherent rule-following outputs. The authors partially recover performance by applying SVD to the combination and truncating to rank 16: 100.0% for meetings, 80.8% for politics, and 82.4% for expert opinion. This merge must be computed in advance and is described as too costly for real-time combination. Conflicting rules and priorities are not tested. In the politics comparison, the adapter scores 100.0% while Llama Guard emits an unsafe tag in 7.7%, but the tasks are not equivalent: the adapter is explicitly trained to censor every political discussion and generate a resolution, whereas Llama Guard is a general unsafe-content classifier.

The evaluation is a closed loop: the same rules define positive and negative examples and the judge rubric, and the <guard> marker may act as a shortcut. There is no formal human annotation, second judge, adaptive attack, jailbreak, prompt injection, adversarial paraphrase, multilingual test, long-context stress, memory poisoning, or real user. Utility, over-refusal, general capability, naturalness, and persona consistency are not measured quantitatively; persona consistency relies on manual inspection without a protocol or N. Rejecting all politics or all specialized questions is a product policy, not a universal safety definition. The sole cited repository currently returns 404 even though the paper delegates full hyperparameters to it. Code, data, weights, judge outputs, and figure data are unavailable. The solid evidence is an in-distribution proof of concept: 200 synthetic preferences can teach three explicit rules to one 8B model. It does not establish robust alignment, production safety, or on-demand stackable guardrails.

Pregunta de investigación

¿Pueden guardrails conductuales definidos por trigger y resolución convertirse automáticamente en adaptadores LoRA que controlen un agente-persona cambiante, y pueden combinarse sin perder eficacia?

Método

GPT-4o-mini-2024-07-18 genera, para tres reglas, conversaciones de persona con respuesta aceptada y rechazada. Un Llama-3.1-8B-Instruct cuantizado a 4 bits recibe un LoRA por regla mediante ORPO. Cada regla usa 200 tripletas de entrenamiento y 25 de validación. Un juez LLM puntúa validez y adherencia en conversaciones trigger y neutrales, con y sin adaptador; se comparan contexto variable/fijo, Llama Guard para política y mezcla lineal frente a SVD truncada de los tres adaptadores.

Muestra: Por cada uno de tres guardrails se declaran 200 tripletas sintéticas de entrenamiento y 25 de validación. El baseline se prueba en 50 conversaciones y se promedia sobre cinco ejecuciones por guardrail; el artículo no aclara la relación exacta entre esos 50 casos y las 25 tripletas, ni si las ejecuciones repiten decodificación, datos o entrenamiento. No hay N de inspección humana, seeds, intervalos ni tests adversariales.

Hallazgos

  • Los LoRA individuales obtienen 100,0% de adherencia juzgada en política y encuentros y 96,0% en opinión experta.
  • El modelo base obtiene 6,4%, 8,0% y 47,2% respectivamente bajo la misma rúbrica.
  • La tasa neutral no afectada es 96,8%, 96,0% y 100,0%, aunque se observan cambios políticos no solicitados.
  • La marca <guard> aparece en 100,0%, 100,0% y 92,0% de los triggers.
  • Fijar los campos dinámicos reduce el guardrail político de 100,0% a 68,0%.
  • La suma lineal de LoRA casi falla por completo; SVD rango 16 recupera 100,0%, 80,8% y 82,4%.
  • La comparación 100,0% frente a 7,7% de Llama Guard usa objetivos distintos y no prueba superioridad general de seguridad.
  • El repositorio de código citado está actualmente inaccesible, por lo que las cifras no son reproducibles desde los artefactos oficiales disponibles.

Limitaciones

  • Solo se prueba un Llama 8B cuantizado, un teacher, tres reglas en inglés y un dominio sintético.
  • Train y evaluación siguen las mismas definiciones y el mismo proceso generativo.
  • El juez no se identifica por versión separada ni se calibra con anotación humana.
  • No hay segundo juez, acuerdo, labels por fila o análisis de errores del evaluador.
  • La etiqueta literal <guard> puede actuar como atajo de entrenamiento y evaluación.
  • La muestra efectiva es pequeña y las tasas no incluyen intervalos o significación.
  • Las cinco ejecuciones no se describen como entrenamientos independientes y carecen de seeds.
  • Faltan temperatura, decodificación, revisión exacta de modelo y manejo de outputs inválidos.
  • No hay jailbreaks, prompt injection, paráfrasis, multilingüismo, contextos largos o ataques adaptativos.
  • Política y opinión experta son reglas de rechazo total con riesgo de censura y exceso de rechazo.
  • No se mide utilidad, ayuda, naturalidad, latencia o degradación de capacidades.
  • La consistencia de persona depende de inspección manual sin protocolo, muestra o métrica.
  • El NLL de validación crece durante parte del entrenamiento sin análisis de selección de checkpoint.
  • Llama Guard es un baseline de detección no equivalente al adaptador generativo especializado.
  • No se comparan prompts de sistema, SFT/DPO, decodificación restringida o otros guardrails bajo igual tarea.
  • La mezcla lineal contradice la combinación plug-and-play; SVD debe precomputarse y pierde rendimiento.
  • No se prueban guardrails contradictorios, solapados o con prioridades.
  • El repositorio citado devuelve 404 y faltan hiperparámetros, código, datos, pesos y outputs.

Qué no demuestra

  • Que los adaptadores ofrezcan seguridad general o alineamiento robusto.
  • Que resistan ataques, jailbreaks, inyección de prompt o distribuciones no vistas.
  • Que se preserve cuantitativamente la personalidad, biografía, memoria o estilo del personaje.
  • Que 96-100% de adherencia del juez equivalga a exactitud humana validada.
  • Que el juez sea independiente, calibrado o insensible a la marca <guard>.
  • Que censurar toda política o consulta experta sea una política de seguridad universal.
  • Que el adaptador supere a Llama Guard en una tarea general equivalente.
  • Que los resultados generalicen a otros modelos, reglas, idiomas, personas o usuarios reales.
  • Que se conserven utilidad, capacidades generales, calidad o latencia.
  • Que los LoRA puedan apilarse linealmente en tiempo real.
  • Que reglas conflictivas se resuelvan de manera segura.
  • Que las tasas sean estadísticamente estables sin intervalos ni entrenamientos repetidos.
  • Que el trabajo sea actualmente reproducible con los artefactos públicos disponibles.

Trazabilidad

Alcance: Texto completo

Versión: MIT Press ALIFE 2025 proceedings article, 9 pages including supplement; Crossref metadata and cited GitHub availability also checked

Fuente consultada: https://doi.org/10.1162/isal.a.855

Revisión: Codex 9-page publisher-PDF visual, proceedings metadata, synthetic-data/judge, baseline-equivalence, adapter-merging, safety-validity and current artifact-availability audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Llama-3.1-8B-Instruct, 4-bit quantized target model
  • gpt-4o-mini-2024-07-18 synthetic data generator
  • Unspecified LLM-as-judge
  • Llama Guard politics-detection comparison

Instrumentos y métricas

  • Dynamic persona prompt with biography, traits, expressions, memories and dialogue history
  • Trigger and resolution Guardrail object
  • ORPO with lambda 0.1
  • PEFT LoRA adapters
  • Literal <guard> activation tag
  • LLM-as-judge validity and behavior-adherence JSON rubric
  • Triggering and neutral conversation conditions
  • Full, fixed and semi-fixed synthetic-context ablations
  • Linear and rank-16 SVD adapter merging
  • Manual log inspection

Datos utilizados

  • Synthetic meeting-in-person guardrail triplets
  • Synthetic politics guardrail triplets
  • Synthetic expert-opinion guardrail triplets
  • Synthetic triggering and neutral evaluation conversations

Evidencia y localización

  • Método, prompts, datos, tablas, figuras, resultados, mezcla y limitaciones: MIT Press ALIFE 2025 proceedings PDF, 9 pages including supplement; all pages rendered and visually inspected
  • Tipo de publicación, fecha, autoría y licencia: Crossref record for DOI 10.1162/isal.a.855 checked 2026-07-16
  • Repositorio oficial no disponible: Paper code URL, git clone, GitHub REST repository endpoint and exact repository search checked 2026-07-16; repository returned 404
  • Validez del juez, equivalencia del baseline, modularidad y límites de afirmación: reports/verification/article-270-alife-guardrail-synthetic-judge-baseline-adapter-merge-and-artifact-audit.json