What Models Express, Suppress, and Resist: Auditing Open-Weight LLMs with Persona Vectors

Inducción y control de rasgos2026arXivRevisión editorial aprobada

Autores: Winston Zeng, Ali Emami, Jinho D. Choi

Palabras clave: persona vectors, activation steering, behavioral auditing, trait composition, open-weight models, safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
5
Hallazgos
6
Limitaciones
3
Evidencias

Resumen editorial

Español

El trabajo reutiliza los vectores de persona como instrumento diagnóstico para describir qué conductas aparecen por defecto, cuáles aumentan mediante intervención y cuáles resisten el protocolo de extracción. Construye 53 rasgos en cuatro dominios, 17 clínicos, 19 genéricos, 8 educativos y 9 agénticos, y estudia Qwen3-8B y gpt-oss-20b. Para cada rasgo resta activaciones medias de respuestas positivas y negativas, inyecta el vector en cinco capas con coeficientes de 0 a 2,5 y puntúa la expresión con gpt-oss-20b como juez. La clasificación usa umbrales descriptivos: natural si el baseline es al menos 70, steerable si parte bajo y gana al menos 10 puntos, e intractable si no produce señal utilizable. Los nueve rasgos agénticos resultan naturales en ambos modelos; en clínica coinciden en seis naturales, y un único psicólogo considera deseables seis de ellos dentro de 16 coincidencias sobre 17 etiquetas. En Qwen, 171 pares genéricos producen 64 interacciones constructivas, 67 dominantes y 40 destructivas; todas las destructivas contienen dos rasgos steerable. Un vector de “evil” extraído de un fine-tune menos seguro eleva en el modelo base la puntuación hasta 61,61 ± 44,42, con gran dispersión. Estos resultados describen efectos sobre salidas, no mecanismos ni coordenadas semánticas únicas. Faltan controles con vectores aleatorios equivalentes, etiquetas permutadas y barridos negativos; el juez evalúa también sus propias generaciones y solo se contrasta cualitativamente en tres rasgos. Las varianzas completas existen para 22 de 53 rasgos, el experto es uno y solo se prueban dos modelos. El artículo promete liberar artefactos benignos tras aceptación, pero en la versión auditada no hay código, datos ni salidas públicas para reproducir las tablas.

English

The paper repurposes persona vectors as a diagnostic instrument for describing which behaviors appear by default, which can be amplified by intervention, and which resist the extraction protocol. It defines 53 traits across four domains, 17 clinician, 19 generic, 8 elementary-education, and 9 agentic traits, and studies Qwen3-8B and gpt-oss-20b. For each trait, the method subtracts mean activations from positive and negative responses, injects the resulting vector at five layers with coefficients from 0 to 2.5, and uses gpt-oss-20b to judge trait expression. Classification relies on descriptive thresholds: natural when baseline expression is at least 70, steerable when a low baseline gains at least 10 points, and intractable when no usable signal is produced. All nine agentic traits are natural in both models; the clinician maps share six natural traits, and one psychologist rates those six as desirable within 16 agreements over 17 labels. In Qwen, 171 generic pairs yield 64 constructive, 67 dominant, and 40 destructive interactions; every destructive case combines two steerable traits. An “evil” vector extracted from a less-safe fine-tune raises the base model’s judged score to 61.61 ± 44.42, with substantial dispersion. These are output-level effects, not mechanisms or unique semantic coordinates. Random norm-matched vectors, shuffled labels, and systematic negative sweeps are absent; the judge also scores its own generations and receives only a qualitative three-trait check. Full variance exists for 22 of 53 traits, the expert sample is one, and only two models are tested. Benign artifacts are promised after acceptance, but no public code, data, or outputs reproduce the audited version’s tables.

Pregunta de investigación

¿Puede un mapa amplio de vectores de persona distinguir conductas naturales, amplificables y resistentes, y cómo interactúan los rasgos al combinar vectores?

Método

Extracción contrastiva de vectores en 53 rasgos y dos modelos abiertos; barrido de cinco capas y seis coeficientes, puntuación automática 0–100, taxonomía por umbrales, 171 combinaciones de rasgos genéricos y transferencia de un vector desde un fine-tune menos seguro.

Muestra: Dos modelos principales; 53 rasgos por modelo. El análisis de pares cubre los 171 pares de 19 rasgos genéricos solo en Qwen3-8B. Las varianzas por prompt se conservan para 22 rasgos.

Hallazgos

  • Los rasgos agénticos y de ayuda aparecen principalmente como defaults naturales.
  • Los estilos exagerados o indeseables muestran mayor ganancia de steering.
  • Las 40 interacciones destructivas aparecen únicamente entre dos rasgos steerable.
  • La transferencia desde un fine-tune permite inducir una conducta que el protocolo estándar no extrae del modelo base.
  • El cribado barato coincide con el barrido completo en 92,5 % y 88,5 %, pero es heurístico.

Limitaciones

  • Dos familias y tamaños confunden comparaciones con efectos de post-training.
  • Un único experto etiqueta deseabilidad clínica.
  • El juez gpt-oss-20b puntúa sus propias generaciones.
  • Faltan controles de especificidad y varianza completa.
  • Los umbrales y categorías son operativos, no constructos validados.
  • Código, datos y resultados no estaban publicados.

Qué no demuestra

  • No identifica mecanismos internos ni vectores semánticos únicos.
  • No demuestra personalidad, agencia o rasgos humanos en los modelos.
  • No prueba que el steering sea seguro o específico.
  • No demuestra generalización a otros modelos, dominios o fine-tunes.
  • No convierte la coincidencia con un experto en validación clínica.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2607.13162v2; complete 21-page PDF and TeX source; no public code/data release at audit time

Fuente consultada: https://arxiv.org/abs/2607.13162v2

Revisión: Codex 21-page visual full-text, TeX, method, claim and artifact audit, 2026-07-18

Aprobación: Codex fidelity pass, 2026-07-18

Modelos evaluados

  • Qwen3-8B
  • gpt-oss-20b
  • Qwen2.5-7B-Instruct (judge sanity check)
  • GPT-4.1-mini (comparison judge)
  • amoral-gpt-oss fine-tune (evil-vector source)

Instrumentos y métricas

  • 53-trait persona-vector inventory
  • Natural/steerable/intractable threshold map
  • 0–100 LLM-judge score
  • Pairwise constructive/dominant/destructive taxonomy

Datos utilizados

  • 40 elicitation prompts per trait
  • Clinician, generic, elementary-education, and agentic trait inventories

Evidencia y localización

  • Inventario, extracción y umbrales: arXiv v2, sections 3–5 and Tables 1–2
  • Resultados simples, pares y vector transferido: arXiv v2, section 6, Figures 3–5 and Tables 2–3
  • Controles ausentes, juez, varianza y artefactos: arXiv v2, sections 8–9 and Appendices A–E