Your Language Model Secretly Contains Personality Subnetworks

Inducción y control de rasgos2026OpenReviewRevisión editorial aprobada

Autores: Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

Palabras clave: Large Language Models, Persona Steering, Behavioral Control, Pruning, Sparse Subnetworks, Mechanistic Interpretability, MBTI, Role-Playing, AI Safety, Reproducibility

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
10
Hallazgos
14
Limitaciones
12
Evidencias

Resumen editorial

Español

Este artículo aceptado como póster en ICLR 2026 propone localizar y conservar subconjuntos dispersos de pesos que favorezcan una persona o conducta. Usa estadísticas de activación sobre pequeños conjuntos de calibración y variantes inspiradas en Wanda y SparseGPT; para pares opuestos añade una selección contrastiva. Evalúa Llama-2-13B, Llama-3-8B y, en parte, Qwen2.5-14B con cuestionarios MBTI, preferencias de búsqueda de poder o riqueza, identificación de alucinaciones y preguntas de RoleAgentBench. Las máscaras suelen superar a Prompt y RAG en los resultados publicados, pero SFT supera a todas las variantes de poda en las seis comparaciones de AI Persona de Table 4. Además, el conjunto de tareas no mide un único constructo psicológico: el propio apéndice reconoce que MBTI no es una prueba psicométrica validada; identificar alucinaciones es una capacidad, y emular personajes o maximizar riqueza son conductas distintas. La evidencia pública tampoco reproduce la afirmación central. El repositorio tiene trece archivos y no contiene las canalizaciones de MBTI, RoleAgent, MMLU, HellaSwag, Qwen, SFT o RAG ni resultados o tests. En la evaluación liberada, la máscara siempre se combina con un prompt explícito de la persona, por lo que no se prueba control sin contexto externo. La función denominada SparseGPT carga datos de calibración pero no los usa para puntuar pesos y produce la misma máscara para seek y reject. La implementación contrastiva Sparse usa una única diferencia absoluta y asigna el top-k a una persona y el siguiente conjunto disjunto a la otra, no la comparación direccional descrita en la ecuación del artículo. Las máscaras se aplican sobre capas densas sin kernel disperso ni medidas de latencia, de modo que tampoco se demuestra ahorro de inferencia. Por último, la degradación general declarada como <=1,6 % es incorrecta: Sparse baja HellaSwag de 0,675 a 0,653, es decir, 2,2 puntos porcentuales. La lectura defendible es que la poda guiada puede modificar respuestas conductuales en estos benchmarks, pero el artefacto actual no permite reproducir los resultados ni demostrar subnetworks naturales de personalidad, causalidad mecanística, eficiencia real, fiabilidad estadística o seguridad.

English

This ICLR 2026 poster proposes locating and retaining sparse weight subsets that favor a persona or behavior. It uses activation statistics from small calibration sets with Wanda- and SparseGPT-inspired variants, adding contrastive selection for opposing pairs. Llama-2-13B, Llama-3-8B, and partly Qwen2.5-14B are evaluated on MBTI questionnaires, power- or wealth-seeking preferences, hallucination identification, and RoleAgentBench questions. Published masks often outperform Prompt and RAG, but SFT is higher than every pruning variant on all six AI Persona comparisons in Table 4. The tasks also do not measure one psychological construct: the appendix acknowledges that MBTI is not a validated psychometric test; hallucination identification is a capability, while character emulation and wealth maximization are different behaviors. The public evidence does not reproduce the central claim. The repository contains thirteen files and no MBTI, RoleAgent, MMLU, HellaSwag, Qwen, SFT, or RAG pipelines, results, or tests. In the released evaluator, a mask is always combined with an explicit persona prompt, so control without external context is not tested. The function named SparseGPT loads calibration data but does not use it to score weights and produces the same seek and reject mask. The contrastive Sparse implementation uses one absolute difference and assigns the top-k weights to one persona and the next disjoint set to the other, rather than the directional comparison described by the paper's equation. Masks are applied to dense Linear layers without a sparse kernel or latency measurements, so inference savings are not demonstrated either. Finally, the claimed general-capability degradation of at most 1.6% is incorrect: Sparse lowers HellaSwag from 0.675 to 0.653, a 2.2-percentage-point loss. The defensible reading is that activation-guided pruning can alter behavioral answers on these benchmarks, but the current artifact cannot reproduce the results or establish natural personality subnetworks, mechanistic causality, real efficiency, statistical reliability, or safety.

Pregunta de investigación

¿Contienen los LLM subconjuntos dispersos de parámetros especializados en personas o conductas que puedan identificarse con datos de calibración y aislarse mediante poda, sin entrenamiento adicional?

Método

El trabajo ejecuta textos de calibración etiquetados por persona y combina magnitud de pesos con estadísticas de activación para seleccionar, fila a fila, pesos de capas Linear de atención y MLP; embeddings y LM head quedan sin podar. Compara variantes Wanda y Sparse, y para pares opuestos propone una poda contrastiva destinada a reducir el solapamiento entre máscaras. Evalúa Llama-2-13B, Llama-3-8B y Qwen2.5-14B frente a Prompt, RAG y SFT en MBTI, AI Persona y RoleAgentBench, añade MMLU y HellaSwag como controles generales y restaura capas individuales como prueba mecanística. La auditoría contrastó las 19 páginas del artículo con el commit público ec12c292, trazó ambas implementaciones Python, perfiló los nueve CSV y recalculó las afirmaciones numéricas comprobables.

Muestra: El artículo informa 128 oraciones de calibración con longitud máxima 512 y semilla 42 para el procedimiento principal. El repositorio libera 642 filas de entrenamiento de poder, 623 de riqueza y 700 de alucinación, además de 200 ejemplos de test por tarea y duplicados de algunos ficheros de test. No publica tamaños completos ni outputs por ejecución para todos los experimentos del artículo.

Hallazgos

  • En AI Persona, las variantes de poda superan normalmente Prompt y RAG; Sparse contrastive alcanza 56,5/64,5/96,0 % en poder/riqueza/alucinación con Llama-2 y 60,5/66,0/96,0 % con Llama-3.
  • SFT obtiene 64,0/71,0/97,5 % con Llama-2 y 69,5/71,5/98,5 % con Llama-3: es superior a todas las máscaras en las seis comparaciones de Table 4.
  • En RoleAgentBench, Sparse mejora frente a Prompt y RAG en los valores publicados; las filas Prompt de Llama-2 y Llama-3, sin embargo, son idénticas en los cinco dominios y el artículo no lo explica.
  • Qwen2.5-14B muestra el mismo patrón de puntos: Sparse contrastive informa 58,0 % en poder y 67,5 % en riqueza frente a 44,5 % y 46,0 % de Prompt.
  • La función pública mask.py::phase2_sparsegpt_mask no usa activaciones ni los tensores de calibración para puntuar pesos; por construcción genera máscaras seek y reject idénticas.
  • contra.py::phase2_sparse_mask_contrastive usa una única puntuación absoluta para ambas personas y fuerza conjuntos disjuntos top-k y next-k; no implementa la comparación persona-direccional de la ecuación publicada.
  • mask.py y contra.py mantienen prompts explícitos de poder o riqueza durante la evaluación enmascarada; el artefacto compara prompt contra prompt+máscara, no persona sin contexto externo.
  • La pérdida general publicada para Sparse es 0,016 en MMLU y 0,022 en HellaSwag: 1,6 y 2,2 puntos porcentuales, no <=1,6 % en ambos.
  • El repositorio oficial contiene trece archivos, tres commits y solo código parcial de AI Persona; no permite regenerar la mayoría de tablas ni verificar los resultados exactos.
  • Las capas permanecen densas después de multiplicar sus pesos por máscaras booleanas; sin kernels dispersos o benchmarks, la supuesta reducción de coste de inferencia no está demostrada.

Limitaciones

  • MBTI no está validado como prueba psicométrica en este estudio y el propio artículo lo reconoce; tampoco hay validez convergente, discriminante, test-retest o invariancia.
  • Poder, riqueza, detección de alucinaciones y emulación de personajes no constituyen una sola variable de personalidad humana.
  • No hay repeticiones, desviaciones estándar, intervalos de confianza, tests estadísticos ni análisis de sensibilidad a semillas pese al uso de 'significativamente'.
  • Faltan controles con máscara aleatoria, magnitud equiparada, permutación de etiquetas, prompt neutral, mismo prompt sin máscara y transferencia de la misma máscara entre datasets.
  • Table 7 restaura solo tres módulos seleccionados y no incluye la fila ENFJ original, capas aleatorias, máscaras aleatorias, repeticiones ni incertidumbre; no demuestra una ruta causal única.
  • El menor Jaccard de las máscaras contrastivas no es evidencia independiente de disentanglement porque la propia construcción impone separación.
  • El ejemplo de control continuo combina una sola proporción 70/30 y contiene una errata que llama introversión a ambos componentes; no prueba linealidad ni predictibilidad.
  • El repositorio no incluye licencia, tests, CI, comandos, identificadores de modelo, resultados, máscaras, logs o manifiesto de ejecuciones.
  • Los datos públicos no se conectan de extremo a extremo con los dos ficheros de calibración seek/reject requeridos por el CLI; cada CSV de entrenamiento contiene pregunta y ambas respuestas opuestas.
  • mask.py usa pérdida media sobre prompt y respuesta completos, mientras contra.py suma NLL solo de la respuesta; no se documenta cuál produjo las tablas.
  • mask.py baraja calibración sin fijar semilla, en conflicto con la declaración de semilla 42.
  • Los ceros en tensores densos no producen automáticamente aceleración; no se publican latencia, throughput, memoria, energía ni tamaño operativo de máscaras.
  • No hay evaluación de seguridad pese a optimizar conductas de búsqueda de poder y riqueza, ni estudio de abuso, harmlessness, refusals o efectos colaterales.
  • La afirmación training-free omite el coste de datos etiquetados, forward passes completos, construcción y almacenamiento de una máscara por persona.

Qué no demuestra

  • No demuestra que los LLM contengan circuitos discretos, naturales y humanamente equivalentes de personalidad.
  • No demuestra control de persona sin prompt externo; el evaluador público usa prompt y máscara conjuntamente.
  • No permite reproducir Sparse, Sparse contrastive ni la mayoría de resultados desde el código liberado.
  • No valida que MBTI, búsqueda de poder o riqueza, factualidad y role-play midan un mismo constructo.
  • No demuestra superioridad frente a SFT; SFT gana todas las comparaciones de AI Persona publicadas.
  • No demuestra reducción real de coste de inferencia en la implementación densa liberada.
  • No prueba que los pesos o capas seleccionados sean rutas causales únicas, necesarias o genuinas de personalidad.
  • No demuestra control continuo y predecible con un único ejemplo de mezcla.
  • No establece fiabilidad estadística entre semillas, muestras o ejecuciones.
  • No establece que amplificar búsqueda de poder o riqueza sea seguro, deseable o una personalización responsable.

Trazabilidad

Alcance: Texto completo

Versión: ICLR 2026 Poster; accepted 19-page conference paper mirrored as arXiv:2602.07164v1

Fuente consultada: https://openreview.net/forum?id=zzo3Sy3NSX

Revisión: Codex complete bilingual full-text fidelity pass using the accepted ICLR 2026 paper, all-page visual inspection, official repository and commit-history audit, code-to-equation trace, public dataset profiling, published-table arithmetic checks, construct-validity and safety boundary review, and reproducibility assessment; summaries written from paper, code, and artifact evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Llama-2-13B
  • Llama-3-8B
  • Qwen2.5-14B

Instrumentos y métricas

  • MBTI questionnaire adapted from Machine Mindset
  • AI Persona power-seeking multiple-choice task
  • AI Persona wealth-seeking multiple-choice task
  • AI Persona hallucination-identification task
  • RoleAgentBench multiple-choice role consistency
  • MMLU
  • HellaSwag

Datos utilizados

  • Machine Mindset MBTI questionnaire
  • AI Persona benchmark
  • RoleAgentBench
  • MMLU
  • HellaSwag
  • Nine public AI Persona CSV files in the official Persona repository at commit ec12c292

Evidencia y localización

  • Pregunta, método, contribuciones y comparación de costes: Accepted PDF pages 1-6, Abstract and Sections 1-4.1
  • AI Persona y RoleAgentBench: Accepted PDF pages 7-8, Tables 4-5 and Section 4.2
  • Pérdida general y prueba mecanística: Accepted PDF pages 8-9, Tables 6-7 and Sections 4.3-4.4
  • Tamaño de calibración: Accepted PDF page 9, Table 8 and Section 4.6
  • Qwen, base versus instruction, layer-aware, mezcla y Jaccard: Accepted PDF pages 13-15, Appendices C-G and Tables 10-13
  • Límite psicométrico de MBTI y prompt abierto: Accepted PDF pages 16-18, Appendices I-J and Tables 15-16
  • Prompt explícito y pérdida completa en mask.py: Official repository commit ec12c292, mask.py lines 137-184
  • Sparse ignora calibración y replica máscaras: Official repository commit ec12c292, mask.py lines 95-135
  • Contrastive Sparse y evaluación con prompt: Official repository commit ec12c292, contra.py lines 220-357 and 359-407
  • Cobertura, historial y datos del repositorio: Official repository commit ec12c292, complete 13-file inventory, three-commit history, nine CSV files and 15 July 2026 data profile
  • Auditoría integral de código, método, constructo y seguridad: reports/verification/article-196-code-method-and-construct-audit.json
  • Inspección visual completa: All 19 accepted ICLR 2026 PDF pages rendered and visually inspected on 15 July 2026