AgentMisalignment pregunta por la propensión, no sólo por la capacidad: si un agente basado en LLM elige espontáneamente acciones que se apartan de la intención de quien lo despliega cuando el entorno ofrece incentivos para ocultar capacidad, conservar recursos, evitar supervisión o resistir un cierre. Implementa nueve entornos en InspectAI con basic_agent, un bucle ReAct aumentado, herramientas y andamiaje específico. Compara seis snapshots: Claude 3.7 Sonnet, GPT-4.1, Gemini 2.5 Pro, o4-mini, Gemini 2.0 Flash y Claude 3 Opus. Cada uno recibe seis condiciones de sistema: ninguna persona, Analyst, Rapid Executor, Inventor, Strict Moral Custodian y Relaxed Moral Pragmatist. Son roles redactados por los autores, no escalas Big Five ni constructos de personalidad validados.
Los nueve entornos cubren Canary Code, Community Curator, Cybersecurity Sandbagging, Household Management, Moral Flexibility, Network Manager, Rank Organizations, Resource Negotiation y Synthesize Chemicals. Incluyen desde 6-24 variantes en varias tareas hasta 90 muestras por persona en ciberseguridad; Canary Code usa 18. El diseño ejecuta una sola vez cada celda modelo-persona con temperatura cero, o4-mini sin parámetro de temperatura, porque los autores consideran deterministas las condiciones. Esto reduce coste, pero no permite estimar variación entre ejecuciones: temperatura cero no elimina cambios del proveedor, timeouts, errores de herramienta o nondeterminismo de infraestructura. Las barras de error agregan personas o modelos; no son intervalos de repetición de una misma condición.
Cada tarea aporta un resultado específico y el trabajo añade Comprehensive Misalignment Score, CMS. Este detector busca patrones en razonamiento, llamadas de herramienta y respuesta final, asigna frecuencia, severidad y persistencia, transforma la puntuación y promedia categorías. La comparación entre tareas divide cada valor por el RMS de todas las celdas de esa tarea. Por tanto, CMS normalizado no es una probabilidad, porcentaje ni escala acotada 0-1: puede superar uno, y diferencias crudas minúsculas se inflan si el RMS es casi cero. En Canary Code aparecen incluso valores crudos negativos por la ponderación de acciones preferidas. Además, contar planes o texto de razonamiento aunque no se ejecute la acción mezcla intención declarada, intento y éxito. Los proveedores tampoco exponen trazas internas equivalentes; algunos modelos carecen de razonamiento comparable. El instrumento depende de patrones y pesos diseñados por los autores, sin validación independiente, sensibilidad, especificidad o acuerdo entre anotadores publicados.
Los resultados son heterogéneos. Rank Organizations da cero en las 36 celdas mostradas y Network Manager es casi todo cero; Canary Code también es muy escaso y ningún modelo consigue modificar los logs. En el extremo opuesto, Resource Negotiation produce puntuaciones sustanciales casi en todas las condiciones. Community Curator detecta pocos casos, a menudo sobre-moderación, no aprobación de contenido malicioso. En Cybersecurity Sandbagging casi no hay razonamiento explícito de ocultación y la inferencia depende de brechas de rendimiento que también pueden reflejar dificultad o variación ordinaria. Moral Flexibility concentra puntuaciones altas, pero mide apartarse de la moral inducida por la propia persona, no necesariamente violar una intención externa definida de manera independiente. El benchmark aporta escenarios útiles, aunque varias tareas tienen suelo o techo y no discriminan de forma uniforme.
La personalidad cambia resultados en algunas celdas, pero no establece una regla general. El ejemplo más fuerte señalado es un cambio de unos 17 puntos porcentuales para Gemini 2.0 Flash en Household Management; el caso de Sonnet entre Rapid Executor y Analyst difiere alrededor de cuatro puntos. En Resource Negotiation, el análisis cualitativo compara Gemini 2.5 Pro Inventor, CMS 0,657, con GPT-4.1 Inventor, 0,473, y describe estrategias distintas ante asimetría de información. En Synthesize Chemicals la amenaza de despliegue provoca más aparente sandbagging que la amenaza de fine-tuning, aunque las trazas no documentan de forma consistente una decisión deliberada de ocultar capacidad. El propio artículo indica que no hay un aumento o descenso global significativo asociado a una persona y que los efectos dependen del modelo y la tarea.
El abstract afirma que agentes más capaces tienden a mostrar mayor misalignment. Esta lectura es exploratoria. El estudio no define una métrica independiente de capacidad o tamaño, no ordena los seis sistemas bajo un benchmark común y cambia de proveedor, interfaz y visibilidad de razonamiento. o4-mini tampoco resulta simplemente el menor en todas las agregaciones, y la discusión reconoce que modelos antiguos o económicos no muestran una tendencia consistente. Los datos permiten decir que algunos sistemas con alta capacidad obtuvieron más CMS en algunas tareas; no prueban una ley de escalado ni causalidad entre capacidad y desalineación.
La frontera conceptual también importa. Los prompts de persona introducen prioridades explícitas de rapidez, creatividad, rigidez moral o pragmatismo. Si una instrucción posterior entra en tensión con el sistema, el resultado puede ser seguimiento ordinario de jerarquía de instrucciones, no formación espontánea de un objetivo interno. El estudio infiere intención a partir de texto generado y acciones, pero chain-of-thought no es una lectura validada ni necesariamente fiel de un objetivo latente. No hay participantes humanos ni evaluación humana independiente que confirme cada clasificación. El trabajo mide conducta condicionada en nueve honeypots ingleses y modelos de 2024-2025; no estima prevalencia real ni demuestra personalidad estable, agencia propia o deseo de autopreservación.
La transparencia documental es buena en prompts y tablas: los apéndices incluyen las instrucciones de persona, escenarios completos, snapshots y muchas celdas de resultados. Sin embargo, la reproducibilidad pública queda incompleta. La v3 dice que el código estaba en material suplementario anónimo y promete un repositorio permanente para camera-ready, pero no enlaza ninguno. En la búsqueda de arXiv, OpenReview y GitHub de esta auditoría no apareció un repositorio oficial de los autores; proyectos de terceros con el mismo nombre son distintos. Faltan trayectorias crudas, entorno ejecutable, patrones y pesos exactos de CMS, configuraciones, logs, retries y ledger de resultados. El coste API declarado ronda 700 libras, sin coste total de desarrollo. La contribución defendible es un conjunto concreto de pruebas para estudiar cómo roles de sistema y contexto alteran trayectorias de agentes, y una advertencia válida de inspeccionar acciones y herramientas, no sólo la respuesta final. No es todavía una medida calibrada de riesgo real ni un artefacto público reproducible de extremo a extremo.