Neuron-based Personality Trait Induction in Large Language Models

Inducción y control de rasgos2025OpenReviewRevisión editorial aprobada

Autores: Jia Deng, Tianyi Tang, Yanbin Yin, Wenhao Yang, Wayne Xin Zhao, Ji-Rong Wen

Palabras clave: Neuron-based Personality Trait Induction, PersonalityBench, Big Five, FFN Activation Steering, Llama-3-8B-Instruct, Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3, Gemma-2-9B-it, SocialIQA, IPIP-NEO-300, Human Evaluation, Mechanistic Interpretability, Inference-time Intervention, Behavioral Steering

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
15
Hallazgos
24
Limitaciones
12
Evidencias

Resumen editorial

Español

NPTI propone inducir polos positivos y negativos de los Big Five mediante intervención directa en activaciones FFN durante la inferencia, sin entrenar ni cambiar los pesos. PersonalityBench combina descripciones derivadas de facetas IPIP-NEO-300 con preguntas situacionales generadas sobre temas UltraChat. Para cada rasgo, Llama-3-8B-Instruct responde a las mismas preguntas bajo descripciones opuestas; se mide por coordenada la diferencia en probabilidad de que la salida SiLU del gate sea positiva y se seleccionan diferencias superiores a +10 % o inferiores a −10 %. En generación, NPTI aumenta las coordenadas del polo objetivo con una función ponderada por delta y su percentil 95 y limita a cero las del polo contrario. En la evaluación automática sobre preguntas derivadas de SocialIQA, NPTI obtiene media agregada 9,43 y varianza 0,49: iguala la media de P2, con menor varianza, y queda 0,18 puntos por debajo de LoRA SFT. Cinco jueces ordenan cinco métodos en 200 preguntas: NPTI logra el mejor rango medio global (2,27) y lidera Extraversion y Neuroticism, pero Simple Prompt, P2 y SFT lideran respectivamente Agreeableness, Conscientiousness y Openness. En Qwen supera ambos prompts en los cinco rasgos; en Mistral y Gemma lo hace solo en aproximadamente la mitad. La técnica tampoco es neutral para capacidades generales: casi todas las intervenciones reducen alguna métrica, Neuroticism+ cae hasta 7 puntos en CommonsenseQA y solo Conscientiousness+ mejora levemente las cuatro. La lectura defendible es que NPTI es un mecanismo white-box competitivo para orientar conducta textual reconocible como rasgos, no que cambie una personalidad psicológica persistente. Los artefactos refuerzan esta cautela: los diez conjuntos públicos contienen entre 10.278 y 31.790 coordenadas por polo; su unión cubre el 27,15 % de los gates FFN de Llama y el 47,48 % de esa unión aparece en dos o más rasgos. Son correlatos distribuidos y solapados, no neuronas exclusivas de personalidad. Además, el repositorio público no reproduce el paper tal como está escrito: aplica una máscara aleatoria no declarada al 90 % de las activaciones objetivo, no fija seed, ejecuta solo el polo reversed, juzga esos outputs con factores del rasgo positivo y conecta P2 a la plantilla equivocada. Omite PAS, ActAdd, SFT, resultados crudos y modelos alternativos, publica una credencial API en texto plano y fija dependencias incompatibles. Por tanto, el artículo aporta una idea técnica y evidencia comparativa relevante, pero sus afirmaciones de estabilidad, especificidad neuronal, paridad general con fine-tuning y reproducibilidad deben limitarse estrictamente al comportamiento evaluado y no justifican despliegue.

English

NPTI induces positive and negative Big-Five poles by intervening directly in FFN activations at inference time, without training or changing model weights. PersonalityBench combines descriptions derived from IPIP-NEO-300 facets with generated situational questions over UltraChat topics. For each trait, Llama-3-8B-Instruct answers the same questions under opposing descriptions; the method measures, per coordinate, the difference in probability that the SiLU gate output is positive and selects differences above +10% or below -10%. During generation, NPTI increases target-pole coordinates with a function weighted by delta and the coordinate's 95th percentile, while clamping opposite-pole coordinates at a maximum of zero. On the SocialIQA-derived automatic test, NPTI reports an aggregate mean of 9.43 and variance of 0.49: it equals P2's mean with lower variance and trails LoRA SFT by 0.18 points. Five judges rank five methods on 200 questions; NPTI has the best overall average rank (2.27) and leads Extraversion and Neuroticism, while Simple Prompt, P2, and SFT respectively lead Agreeableness, Conscientiousness, and Openness. It beats both prompts on all five Qwen traits but only about half of the Mistral and Gemma comparisons. The intervention is not neutral to general capability: almost every condition lowers at least one metric, Neuroticism-positive loses up to 7 points on CommonsenseQA, and only Conscientiousness-positive improves all four slightly. The defensible reading is that NPTI is a competitive white-box mechanism for steering text toward recognizable trait behavior, not a persistent psychological personality change. The artifacts reinforce that caution. The ten public sets contain 10,278-31,790 coordinates per pole; their union covers 27.15% of Llama's FFN gates, and 47.48% of that union occurs in at least two traits. These are broad, overlapping distributed correlates, not exclusive personality neurons. The public repository also does not reproduce the paper as written: it applies an undisclosed random 90% activation mask without a seed, executes only the reversed pole, judges reversed outputs with positive-trait factors, and routes P2 through the wrong template. It omits PAS, ActAdd, SFT, raw results, and alternative-model artifacts, publishes a plaintext API credential, and pins conflicting dependencies. The paper therefore contributes an important technical idea and relevant comparative evidence, but claims of stability, neuron specificity, general parity with fine-tuning, and reproducibility must remain limited to the evaluated behavior and do not justify deployment.

Pregunta de investigación

¿Puede localizarse y controlarse la expresión textual de los polos positivos y negativos de los Big Five identificando coordenadas FFN cuya probabilidad de activación difiere bajo descripciones opuestas, y puede esa intervención competir con prompting, activation addition y LoRA SFT sin modificar los pesos?

Método

Se generan 80 descripciones por polo y unas 36.000 preguntas por rasgo. Llama-3-8B-Instruct responde cada conjunto con una descripción positiva o negativa elegida aleatoriamente. Para cada coordenada del gate GLU se estima la fracción de tokens generados con SiLU mayor que cero; una diferencia de probabilidad mayor que 10 % identifica el polo positivo y menor que −10 % el negativo. En inferencia, el polo contrario se limita a min(0, activación) y el objetivo recibe gamma por percentil 95 por una sigmoide de la diferencia; gamma principal es 1,4. Se compara con adjetivo simple, P2, PAS, ActAdd y LoRA SFT mediante un juez ChatGPT de rasgo y fluidez sobre preguntas SocialIQA, rankings humanos y benchmarks generales. También se prueban Qwen, Mistral y Gemma y se abla gamma, función de pesos, umbral, capas y combinaciones. La auditoría leyó y revisó visualmente las 25 páginas, verificó metadatos arXiv/OpenReview, clonó el repositorio oficial, recontó corpus y conjuntos neuronales, midió solapamientos, contrastó ecuaciones contra código, comprobó sintaxis, credenciales, dependencias, licencias, tests y cobertura reproducible.

Muestra: El paper declara 180.000 preguntas de búsqueda y unas 450 de test. El repositorio contiene 179.986 preguntas de búsqueda, 459 de test y 80 filas de descripciones con los diez polos; no hay duplicados exactos normalizados ni solapamiento exacto búsqueda-test. Los test solo incluyen texto, sin IDs o transformaciones SocialIQA. La calidad se revisa sobre 400 preguntas muestreadas y 50 descripciones por cinco estudiantes chinos CET-6. La evaluación humana de outputs usa cinco jueces y 200 preguntas, 20 por cada uno de los diez polos. Los diez ficheros neuronales públicos suman 216.819 asignaciones y 124.572 coordenadas únicas.

Hallazgos

  • En Llama, NPTI obtiene media automática 9,43 y varianza 0,49; P2 obtiene la misma media con varianza 0,83 y SFT 9,61 con 0,49.
  • NPTI lidera automáticamente Conscientiousness, Extraversion y Neuroticism, pero Simple Prompt supera su media en Agreeableness y P2/SFT lo superan en Openness.
  • El rango humano promedio favorece NPTI: 2,27 frente a 2,32 P2, 2,37 SFT, 2,79 Simple Prompt y 3,40 PAS.
  • Por rasgo humano, NPTI solo lidera Extraversion y Neuroticism; los otros tres rasgos los lideran tres comparadores distintos.
  • La matriz de acuerdo entre jueces va de 0,65 a 0,87, aunque el texto informa 0,67-0,87.
  • En Qwen NPTI supera ambos prompts en los cinco rasgos; en Mistral y Gemma el patrón es mixto y solo cubre aproximadamente la mitad de comparaciones.
  • Los ablations muestran un trade-off: mayor gamma o más neuronas suele elevar el score de rasgo y reducir fluidez.
  • La evaluación general presenta descensos en la mayoría de condiciones; Neuroticism+ pierde 7,0 puntos en CommonsenseQA.
  • Conscientiousness+ es la única condición que mejora ligeramente GSM8K, IFEval loose/strict y CommonsenseQA a la vez.
  • El repositorio contiene 179.986 preguntas de búsqueda, catorce menos que la cifra exacta del README, y 459 preguntas de test.
  • Los conjuntos publicados seleccionan 10.278-31.790 coordenadas por polo, media 21.681,9, lejos de una localización escasa.
  • La unión de coordenadas cubre 27,15 % de los 32 por 14.336 gates de Llama-3-8B y 47,48 % de esa unión pertenece a al menos dos rasgos.
  • No se publican outputs, scores, rankings, intervalos, tests de significancia o artefactos para PAS, ActAdd, SFT y modelos alternativos.
  • El código pasa parsing sintáctico de Python y Bash, pero no existe test suite, CI, licencia o receta end-to-end verificable.
  • La implementación pública diverge en rutas centrales: máscara aleatoria 90 %, solo reversed, juez de polaridad incorrecta y plantilla P2 equivocada.

Limitaciones

  • La intervención cambia activaciones durante cada token, pero no modifica pesos ni demuestra estado persistente entre sesiones.
  • PersonalityBench y el juez comparten semántica explícita de los mismos rasgos; el score mide cumplimiento reconocible, no validez psicométrica.
  • El juez conoce el rasgo y sus facetas y no es independiente del modelo usado para generar el benchmark.
  • No hay participantes con rasgos medidos, autoinformes, conducta longitudinal, test-retest o criterio humano externo de personalidad.
  • Los hiperparámetros se eligen mediante el mismo tipo de score de personalidad y fluidez después usado para sostener eficacia.
  • No se publican intervalos, significancia, variación entre seeds o corrección por múltiples rasgos, modelos y ajustes.
  • Los cinco jueces de outputs carecen de descripción de reclutamiento, experiencia, pago, cegamiento, orden, incertidumbre y datos crudos.
  • El desacuerdo mínimo de la tabla es 0,65, no 0,67 como afirma el texto.
  • Los casos de combinación son cualitativos y muy pocos; no validan composicionalidad sistemática.
  • Las degradaciones de benchmarks muestran que la manipulación no está aislada de otras capacidades.
  • Casi la mitad de las coordenadas seleccionadas pertenece a varios rasgos, lo que limita especificidad y explicación causal.
  • El código aplica aleatoriamente solo el 90 % de coordenadas objetivo en cada forward y no fija seed; esto no aparece en la ecuación ni en el paper.
  • La ruta pública de generación recorre únicamente _reversed y no produce ambos polos reportados.
  • El evaluador usa siempre el rasgo positivo y sus factores también para ficheros _reversed.
  • La rama P2 define TEMPLATE_p2 pero llama TEMPLATE_sp; el baseline no coincide con la plantilla declarada.
  • El evaluador usa gpt-4o sin snapshot mediante un endpoint de terceros y no conserva respuesta, coste o metadatos suficientes para replicar.
  • Una credencial API en texto plano permanece en el historial público y debe considerarse comprometida.
  • torch 2.4.0 entra en conflicto con torchaudio 2.3.0, que exige torch 2.3.0; el entorno fijado no es resoluble tal como está.
  • Los scripts hard-codean CUDA device 3 y rutas locales y dependen de internals de vLLM sin documentar versión de Python, CUDA, driver o hardware mínimo.
  • Solo se liberan neuronas de Llama; faltan búsquedas, gamma y outputs de Qwen, Mistral y Gemma.
  • Faltan implementaciones de PAS, ActAdd, LoRA SFT, benchmarks generales, agregación humana y reconstrucción de tablas.
  • Las preguntas test no conservan IDs, splits, opciones o transformaciones SocialIQA y no hay LICENSE o dataset card.
  • La versión arXiv v2 es posterior a ICLR; el repositorio no recibe commits desde noviembre de 2024 y no documenta qué cambió respecto al artefacto publicado.
  • No hay sección específica de limitaciones, ética, consentimiento, estereotipos, usos engañosos, seguridad o gobernanza de personality steering.

Qué no demuestra

  • No demuestra que el modelo adquiera o cambie una personalidad psicológica estable.
  • No demuestra que las coordenadas sean neuronas exclusivas, individualmente causales o interpretables de cada rasgo.
  • No valida PersonalityBench o el juez ChatGPT como instrumentos psicométricos.
  • No demuestra que NPTI supere P2 o iguale SFT en todos los rasgos, modelos y evaluadores.
  • No demuestra estabilidad entre sesiones, prompts, idiomas, decodificaciones o versiones del modelo.
  • No demuestra composición sistemática de múltiples rasgos a partir de unos pocos casos.
  • No preserva de forma general razonamiento, seguimiento de instrucciones, conocimiento, calibración o seguridad.
  • No permite reconstruir íntegramente las tablas centrales desde el repositorio publicado.
  • No establece que el código de 2024 reproduzca arXiv v2 de 2026 o el artefacto oficial de ICLR.
  • No establece seguridad, consentimiento, ausencia de estereotipos ni preparación para producción.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2410.12327v2, revised 10 June 2026, 25 pages, author-marked as published at ICLR 2025; official repository commit 630d2a236e5c8d2484fbd5b71249aedd1fc44195

Fuente consultada: https://arxiv.org/abs/2410.12327v2

Revisión: Codex complete bilingual fidelity pass using the full 25-page author preprint, all-page visual inspection, current arXiv and OpenReview metadata, official repository commit audit, independent corpus and neuron-overlap analysis, paper-code consistency review, dependency and secret checks, and construct/statistical/reproducibility assessment; summaries written from full evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Llama-3-8B-Instruct
  • Qwen2.5-7B-Instruct
  • Mistral-7B-Instruct-v0.3
  • Gemma-2-9B-it
  • gpt-4o-20240806 for PersonalityBench construction
  • ChatGPT/gpt-4o for automatic evaluation

Instrumentos y métricas

  • Big Five personality framework
  • IPIP-NEO-300 facets
  • FFN activation-probability difference
  • 10% neuron-selection threshold
  • 95th-percentile activation scaling
  • LLM-as-judge trait score 1-5
  • LLM-as-judge fluency score 1-5
  • Five-judge response ranking
  • GSM8K
  • IFEval loose and strict
  • CommonsenseQA

Datos utilizados

  • PersonalityBench search set
  • PersonalityBench SocialIQA-derived test set
  • IPIP-NEO-300
  • UltraChat topics
  • SocialIQA
  • Released Llama-3-8B neuron-coordinate JSONs

Evidencia y localización

  • Definición de neurona, probabilidad de activación, umbral e intervención: Author preprint pages 4-6, Sections 3.2-3.3, Equations 1-4
  • Modelos, baselines, hiperparámetros y evaluación: Author preprint pages 6-7, Section 4.1
  • Resultados automáticos y humanos principales: Author preprint page 7, Tables 1-2 and Section 4.2
  • Compatibilidad, ablations, distribución y casos: Author preprint pages 8-10, Tables 3-4 and Figures 3-4
  • Fluidez, eficiencia, acuerdo y capacidades generales: Author preprint pages 14-16, Appendix A, Tables 6-9
  • Calidad de PersonalityBench y anotadores: Author preprint pages 18-19, Appendix B, Tables 10-12
  • Prompts exactos de baseline y jueces: Author preprint pages 20-22, Tables 13-20
  • Corpus liberado y recuentos independientes: Official repository commit 630d2a236e5c8d2484fbd5b71249aedd1fc44195; 179,986 search questions, 459 test questions and 80 description rows recounted on 15 July 2026
  • Tamaño y solapamiento de conjuntos neuronales: Ten official neuron_results JSON files; 216,819 memberships, 124,572 unique coordinates and 59,144 multi-trait coordinates recomputed on 15 July 2026
  • Divergencias paper-código, credencial, dependencias y reproducibilidad: Official repository README, requirements.txt and all eight code/shell files at audited commit
  • Auditoría integral técnica y de validez: reports/verification/article-200-neuron-induction-and-artifact-audit.json
  • Inspección visual completa: All 25 pages of arXiv:2410.12327v2 rendered and visually inspected on 15 July 2026