Identifying and Manipulating Personality Traits in LLMs Through Activation Engineering

Inducción y control de rasgos2024arXivRevisión editorial aprobada

Autores: Rumi Allbert, James K. Wiles, Vlad Grankovsky

Palabras clave: Computation and Language, Artificial Intelligence, Large Language Models, Activation Engineering, Personality Traits

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
13
Hallazgos
40
Limitaciones
17
Evidencias

Resumen editorial

Español

El artículo propone controlar estilos descritos como rasgos de personalidad mediante una intervención en las activaciones internas de un Llama 3 de 8 mil millones de parámetros. Los autores reúnen 179 etiquetas procedentes, según indican, de HEXACO, los Cinco Grandes, análisis léxico, sinónimos y antónimos. Para cada etiqueta aplican a 1.500 instrucciones de Alpaca un prompt de sistema que prescribe el comportamiento deseado y lo comparan con una condición neutral. Extraen las activaciones de la capa 18 y definen la dirección del rasgo como la diferencia entre las medias de ambas condiciones. El checkpoint exacto del modelo, descrito también como «sin censura», no se identifica, y tampoco se especifican posición de token, pooling, parámetros de generación, normalización de la dirección ni partición de entrenamiento y evaluación.

La intervención no realiza ajuste fino ni modifica de forma permanente los pesos. En la ecuación presentada se elimina de una activación su proyección actual sobre la dirección del rasgo y se sustituye por la proyección media observada en los ejemplos del rasgo, multiplicada por un factor α. Los autores sitúan el intervalo útil de α entre 1,3 y 1,4 por observación empírica: valores menores producirían cambios leves y valores mayores texto incoherente. No publican el barrido, una métrica de personalidad, tamaños de efecto ni resultados agregados que sustenten ese intervalo. La demostración conductual consiste principalmente en una tabla con cinco respuestas, base, tímida, apasionada, narcisista y paranoide, a una única pregunta de estrategia de mercado. No hay evaluación ciega, jueces humanos, cuestionarios psicométricos, prompts retenidos, comparación con prompting simple ni medición de capacidades generales.

El resto del trabajo explora la geometría de las 179 direcciones. Muestra PCA, t-SNE y UMAP de una muestra aleatoria de 100 etiquetas, aplica k-means con 20 grupos sobre los vectores originales, estudia reconstrucción mediante componentes principales y compara visualmente una selección codiciosa de vectores base con conjuntos aleatorios. No informa semillas, hiperparámetros de reducción, justificación o estabilidad de k, repeticiones, intervalos de confianza ni valores numéricos completos. Las agrupaciones mezclan rasgos ordinarios con diagnósticos clínicos, parafilias, delitos, estados afectivos y juicios morales. Un grupo reúne, entre otros, «pedophilic», «murderous» y «psychopathic»; otro incluye «autistic» junto a «organized», «perfectionist» y «rigid thinker». Proximidades en espacios reducidos se interpretan como posibles vías o precursores de conducta dañina, pero la geometría de activaciones inducidas por prompts no permite inferir causalidad psicológica o clínica.

El artículo presenta capturas de dos interfaces: selección de personalidades base y diseño modular con deslizadores de componentes principales. Los autores deciden no publicarlas por motivos de seguridad. Tampoco enlazan código, datos, lista completa de prompts o rasgos, checkpoint, demo ni resultados reproducibles. Los usos en juegos, compañeros artificiales, atención al cliente y educación son propuestas, no evaluaciones. La sección ética reconoce riesgos de manipulación, empatía aparente, ocultación de limitaciones y generación tóxica, pero la mitigación concreta se limita a pedir un uso responsable; no se prueba ningún control de seguridad.

La aportación defendible es una prueba exploratoria de que una dirección de diferencia de medias en la capa 18 puede alterar visiblemente el estilo de algunas respuestas de un modelo no identificado con precisión. No demuestra que esa dirección represente un constructo estable de personalidad, que el cambio generalice, que conserve las capacidades del modelo o que las agrupaciones reflejen estructura psicológica interna. La afirmación de que Llama 3 8B tiene 31 capas contradice la configuración oficial de Meta, que declara 32 bloques; podría deberse a indexación de 0 a 31, pero el texto dice «31 layers in total». La ausencia de artefactos y de evaluación cuantitativa impide reproducir o estimar la eficacia, robustez y seguridad del método.

English

The paper proposes controlling styles described as personality traits through an intervention in the internal activations of an 8-billion-parameter Llama 3 model. The authors assemble 179 labels said to come from HEXACO, the Big Five, lexical analysis, synonyms, and antonyms. For each label they apply a system prompt prescribing the target behavior to 1,500 Alpaca instructions and compare it with a neutral condition. They extract Layer 18 activations and define a trait direction as the difference between the two condition means. The exact checkpoint, also described as uncensored, is not identified, and token position, pooling, generation parameters, direction normalization, and train/evaluation partitioning are not specified.

The intervention neither fine-tunes the model nor permanently changes its weights. In the stated equation, the current projection of an activation onto the trait direction is removed and replaced with the mean projection observed in trait-conditioned examples, multiplied by a factor α. The authors identify 1.3–1.4 as a useful α range through empirical observation: lower values allegedly yield small changes and higher values incoherent text. They publish no sweep, personality metric, effect sizes, or aggregate results supporting that range. The behavioral demonstration is mainly a table with five responses, baseline, shy, passionate, narcissistic, and paranoid, to one market-strategy question. There is no blinded evaluation, human rating, psychometric questionnaire, held-out prompt set, prompt-only baseline, or general-capability measurement.

The remainder explores the geometry of the 179 directions. It displays PCA, t-SNE, and UMAP projections for a random sample of 100 labels, runs k-means with 20 groups on the original vectors, studies principal-component reconstruction, and visually compares a greedy basis selection with random vector sets. Seeds, reduction hyperparameters, the rationale and stability of k, repeated runs, confidence intervals, and complete numerical results are not reported. The clusters mix ordinary traits with clinical diagnoses, paraphilias, crimes, affective states, and moral judgments. One group contains, among other labels, pedophilic, murderous, and psychopathic; another places autistic alongside organized, perfectionist, and rigid thinker. Proximity in reduced spaces is interpreted as a possible pathway or precursor to harmful behavior, but the geometry of prompt-induced activations cannot establish psychological or clinical causality.

The paper shows screenshots of two interfaces: base-personality selection and modular design using principal-component sliders. The authors withhold them for safety reasons. They also link no code, data, complete prompt or trait list, checkpoint, demo, or reproducible results. Proposed applications in games, artificial companions, customer service, and education are not evaluated. The ethics section recognizes risks of manipulation, apparent empathy, concealed limitations, and toxic generation, but its concrete mitigation is limited to urging responsible use; no safeguard is tested.

The defensible contribution is an exploratory demonstration that a mean-difference direction at Layer 18 can visibly change the style of some responses from an incompletely identified model. It does not show that the direction represents a stable personality construct, that the effect generalizes, that model capabilities are preserved, or that the clusters reflect internal psychological structure. The statement that Llama 3 8B has 31 layers conflicts with Meta's official configuration, which declares 32 transformer blocks; the authors may be referring to zero-based indices 0–31, but the paper says 31 layers in total. With no artifacts or quantitative evaluation, the method's efficacy, robustness, reproducibility, and safety cannot be estimated.

Pregunta de investigación

¿Puede identificarse una dirección de activación asociada a una etiqueta de personalidad comparando prompts condicionados y neutrales, utilizarse esa dirección para modificar dinámicamente las respuestas de un LLM y analizarse la estructura geométrica conjunta de muchas de esas direcciones?

Método

Estudio exploratorio de ingeniería de activaciones. Para 179 etiquetas, los autores aplican prompts de sistema condicionados por el rasgo y una condición neutral a 1.500 instrucciones de Alpaca, extraen activaciones de la capa 18 de un modelo descrito como Llama 3 8B sin censura y calculan una diferencia de medias. Una ecuación sustituye la proyección actual de la activación sobre cada dirección por una proyección media escalada con α. La validación conductual es cualitativa y se complementa con PCA, t-SNE, UMAP, k-means con k=20, reconstrucción mediante componentes principales y capturas de una interfaz no publicada. La auditoría editorial leyó y renderizó las 24 páginas, verificó metadatos y licencia, contrastó la configuración oficial de Llama 3 y buscó los artefactos que el artículo no enlaza.

Muestra: Se procesan 1.500 prompts de Alpaca para cada una de 179 etiquetas y su condición neutral, aunque no se informa el número efectivo de pares, fallos o exclusiones. Las visualizaciones iniciales usan 100 direcciones elegidas aleatoriamente. La evaluación visible del comportamiento contiene una sola instrucción y cinco respuestas. No hay participantes humanos, conjunto de prueba separado ni replicaciones documentadas.

Hallazgos

  • Los autores construyen una dirección por etiqueta restando la activación media neutral de la activación media bajo el prompt condicionado.
  • La capa 18 se selecciona porque, según una observación no cuantificada, produjo el mayor efecto.
  • La intervención sustituye la proyección actual sobre la dirección por una proyección media del rasgo escalada mediante α.
  • Los autores sitúan el intervalo empírico útil de α entre 1,3 y 1,4, sin publicar el barrido o la métrica utilizada.
  • Una tabla cualitativa muestra cambios visibles de tono entre las condiciones base, tímida, apasionada, narcisista y paranoide.
  • PCA, t-SNE y UMAP producen mapas visuales en los que algunas etiquetas semánticamente próximas aparecen cercanas.
  • K-means divide los 179 vectores originales en 20 agrupaciones, sin validación del número de grupos.
  • La reconstrucción PCA reduce el error al aumentar los componentes, como es esperable, pero no se fija un umbral u óptimo cuantitativo.
  • Una selección codiciosa de vectores base presenta menor error visual que selecciones aleatorias, sin estadística inferencial.
  • Los vecinos de la agrupación denominada socialmente indeseable cambian según PCA, t-SNE y UMAP.
  • Las capturas muestran que los autores implementaron prototipos para escoger etiquetas base y combinar componentes principales.
  • Los autores no publican la interfaz por razones de seguridad y reconocen riesgos de manipulación y generación dañina.
  • La evidencia respalda cambios estilísticos exploratorios en ejemplos seleccionados, no modificación psicométricamente validada de personalidad.

Limitaciones

  • El artículo no identifica el checkpoint exacto de Llama 3 8B ni aclara si usa una variante base, instruct o modificada.
  • La descripción «uncensored» no permite conocer qué salvaguardas fueron eliminadas ni bajo qué licencia o procedimiento.
  • El texto afirma que el modelo tiene 31 capas, mientras la configuración oficial de Meta define 32; no aclara si cuenta índices de 0 a 31.
  • No se publica código, configuración, dataset derivado, lista completa de rasgos, prompts completos, checkpoint, demo o resultados estructurados.
  • No se especifican hardware, software, dependencias, precisión numérica, coste, tiempo de ejecución o semilla.
  • No queda claro qué posición de token o forma de pooling produce cada vector de activación.
  • No se detallan el contexto exacto, plantillas completas, respuestas generadas ni parámetros de decodificación.
  • La dirección se trata matemáticamente como si estuviera normalizada, pero no se documenta esa normalización.
  • No se aclara si la diferencia de medias se calcula con pares de prompts o como dos muestras independientes.
  • La selección de la capa 18 se apoya en una observación empírica sin barrido, tabla, métrica o comparación por capas.
  • El intervalo α=1,3–1,4 carece de resultados agregados, criterio de éxito y ejemplos sistemáticos para otros valores.
  • No existe separación entre prompts empleados para construir las direcciones y prompts retenidos para evaluarlas.
  • Los prompts de sistema explicitan marcadores lingüísticos del rasgo, por lo que la dirección puede capturar palabras, estilo e instruction-following.
  • No se compara contra prompting de persona sin intervención, activación aleatoria, etiquetas permutadas, CAA, fine-tuning o controles equivalentes.
  • La validación conductual visible usa una sola pregunta y respuestas escogidas para cinco condiciones.
  • No hay jueces ciegos, acuerdo entre anotadores, evaluación humana, cuestionarios, clasificadores de rasgos o métricas automáticas.
  • No se reportan tamaños de efecto, varianza, intervalos de confianza, pruebas estadísticas ni tasa de fallos.
  • La afirmación de conservar la comprensión general no se evalúa con benchmarks de capacidad o seguridad.
  • No se estudian estabilidad entre ejecuciones, prompts, dominios, idiomas, culturas, checkpoints, familias de modelos o capas.
  • La procedencia de las 179 etiquetas no se ofrece de forma auditable ni se cuantifica cobertura de HEXACO o Big Five.
  • La lista mezcla rasgos de personalidad con diagnósticos, síntomas, parafilias, delitos, preferencias, estilos y juicios morales.
  • No participan especialistas clínicos, psicómetras, expertos en ética ni personas de grupos afectados en el etiquetado.
  • No se aporta validez de constructo, convergente, discriminante, predictiva o incremental para las direcciones.
  • Con 179 puntos en 4.096 dimensiones, las visualizaciones bidimensionales son exploratorias y potencialmente inestables.
  • No se publican semillas ni hiperparámetros de PCA, t-SNE, UMAP y k-means.
  • La figura usa solo 100 de las 179 direcciones sin explicar el muestreo ni mostrar replicaciones.
  • No se justifica k=20 mediante silhouette, estabilidad, teoría o comparación con otros valores.
  • No se aclara si k-means opera sobre vectores normalizados ni qué métrica de distancia se emplea.
  • Distancias y vecindarios de PCA, t-SNE y UMAP no tienen el mismo significado y no permiten una comparación causal directa.
  • La proximidad semántica puede proceder del propio texto de las instrucciones, no de una estructura psicológica interna del modelo.
  • Interpretar vecinos geométricos como contribuyentes o precursores de conducta dañina excede la evidencia observacional.
  • Agrupar «autistic» con rigidez, obsesión y perfeccionismo reproduce estereotipos y confunde diagnóstico con personalidad.
  • El grupo socialmente indeseable reúne categorías clínicas, delitos y juicios morales sin una definición válida del constructo.
  • La comparación de reconstrucción codiciosa frente a aleatoria no publica valores, repeticiones, semillas o incertidumbre.
  • La interfaz no está disponible y no tiene estudio de usabilidad, accesibilidad, latencia, seguridad o comportamiento adversarial.
  • Los posibles usos en juegos, compañía, atención al cliente y educación no se prueban con usuarios ni resultados de tarea.
  • La mitigación ética se limita en gran medida a recomendaciones de responsabilidad; no se implementan barreras, auditorías o controles.
  • No existe una sección formal de limitaciones y la conclusión emplea lenguaje más fuerte que la evidencia presentada.
  • La bibliografía es breve y algunas bases metodológicas se apoyan en fuentes secundarias o comunitarias.
  • La falta de artefactos impide reproducir las figuras, verificar los clusters o comprobar la fórmula de intervención.

Qué no demuestra

  • No demuestra que los LLM posean una personalidad humana o un rasgo psicológico estable.
  • No valida las 179 etiquetas mediante HEXACO, Big Five u otro instrumento psicométrico.
  • No demuestra que la dirección encontrada sea específica del rasgo y no del texto del prompt o del estilo lingüístico.
  • No prueba que el efecto generalice fuera de los ejemplos mostrados.
  • No demuestra estabilidad entre modelos, checkpoints, capas, dominios, idiomas o ejecuciones.
  • No establece que α entre 1,3 y 1,4 sea óptimo, seguro o universal.
  • No demuestra que la intervención preserve comprensión, razonamiento, factualidad o seguridad.
  • No prueba que los clusters correspondan a una taxonomía psicológica válida.
  • No permite inferir que una etiqueta próxima cause o anticipe una conducta socialmente dañina.
  • No demuestra que PCA, t-SNE y UMAP ofrezcan resultados consistentes o equivalentes.
  • No prueba la eficacia de la interfaz ni de los usos propuestos.
  • No aporta una comparación de eficacia frente a prompting, fine-tuning u otros métodos de steering.
  • No proporciona salvaguardas verificadas contra manipulación, toxicidad o uso clínico indebido.
  • No ofrece un artefacto reproducible con el que terceros puedan confirmar los resultados.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2412.10427v2 (10 Jan 2025); first submitted 10 Dec 2024; CC BY 4.0

Fuente consultada: https://arxiv.org/pdf/2412.10427v2

Revisión: Codex full-text, visual, methodological, ethical and artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Llama 3 8B, described as uncensored; exact checkpoint and base-versus-instruct variant not reported
  • Layer 18 residual activations with a reported width of 4,096
  • Official Meta Llama 3 configuration used only for editorial verification of the 32-layer architecture

Instrumentos y métricas

  • Trait-conditioned and neutral system prompts
  • Mean-difference activation directions
  • Projection-replacement intervention controlled by alpha
  • PCA, t-SNE and UMAP visualizations
  • K-means clustering with k=20
  • Principal-component reconstruction error
  • Greedy versus random basis-vector selection
  • Unreleased interactive personality-control interfaces

Datos utilizados

  • 1,500 instructions from the Alpaca Dataset
  • 179 personality-related labels assembled by the authors; complete machine-readable list and provenance not released
  • Qualitative response examples for one market-strategy prompt

Evidencia y localización

  • Objetivo, motivación y contribución declarada: arXiv v2, abstract and section 1, pp. 1–2
  • Ecuaciones de diferencia de medias e intervención: arXiv v2, sections 2.2.1–2.2.2, equations 3–5, pp. 3–4
  • Intervalo alfa y preparación de 179 etiquetas: arXiv v2, sections 2.2.2–2.3, pp. 4–5
  • Prompts de rasgo y respuestas cualitativas: arXiv v2, sections 2.3.1–2.3.2 and Table 2, pp. 5–7
  • Modelo, 1.500 prompts, capa 18 y afirmación de 31 capas: arXiv v2, sections 2.3.2–2.4.1 and Figure 1, pp. 7–8
  • PCA, UMAP, t-SNE y muestra aleatoria de 100 vectores: arXiv v2, sections 2.4.1–2.4.2 and Figure 2, pp. 8–9
  • K-means con 20 grupos y composición completa: arXiv v2, section 2.4.3 and Table 3, pp. 8–11
  • Reconstrucción PCA y selección de vectores base: arXiv v2, sections 2.5.1–2.5.2 and Figures 4–5, pp. 11–13
  • Rasgos asociados a componentes principales: arXiv v2, section 2.5.3 and Figures 6–7, pp. 14–15
  • Grupo socialmente indeseable y vecinos geométricos: arXiv v2, section 2.6 and Figures 8–9 and Table 4, pp. 16–17
  • Interpretación ética de precursores y mitigación propuesta: arXiv v2, section 2.6.3, p. 18
  • Interfaces y decisión de no publicarlas: arXiv v2, section 3 and Figures 10–12, pp. 18–21
  • Casos de uso y riesgos éticos: arXiv v2, sections 4–5, pp. 19–21
  • Trabajo futuro y conclusión: arXiv v2, sections 6–7, pp. 21–23
  • Arquitectura oficial de Llama 3 con 32 bloques: Meta Llama 3 official repository, llama/model.py, ModelArgs n_layers=32; checked 15 Jul 2026
  • Versión, fechas y licencia: arXiv:2412.10427v2 metadata; revised 10 Jan 2025; CC BY 4.0
  • Ausencia de artefactos enlazados: arXiv v2 full paper and abstract metadata; targeted repository search audited 15 Jul 2026