Linear Personality Probing and Steering in LLMs: A Big Five Study

Inducción y control de rasgos2025arXivRevisión editorial aprobada

Autores: Michel Frising, Daniel Balcells

Palabras clave: Large Language Models, Personality, Big Five, Persona, Personality Control

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
20
Hallazgos
44
Limitaciones
11
Evidencias

Resumen editorial

Español

Este preprint estudia si direcciones lineales de las activaciones de Llama 3.3 70B pueden representar y modificar los cinco rasgos Big Five. El propio modelo responde, como 406 personajes ficticios, los 50 ítems IPIP y explica cada respuesta. Los autores suman los diez ítems de cada rasgo para obtener cinco puntuaciones y concatenan las explicaciones como descripciones de personaje. Después presentan cada descripción junto a diez instrucciones de Alpaca y extraen activaciones en todas las capas: último token de entrada, media de tokens de entrada y media de tokens generados. Para cada puntuación de rasgo, promedian las activaciones de todos los personajes que comparten esa puntuación y ajustan una regresión lineal por rasgo y capa; también comparan ejes SVD. Las direcciones supervisadas quedan casi ortogonales entre rasgos y separan adjetivos positivos y negativos cuando el propio adjetivo se inserta literalmente en el system prompt. Este resultado es compatible con codificación semántica explícita, pero no valida detección de personalidad: las etiquetas y los textos proceden del mismo modelo, las explicaciones reformulan el contenido y la polaridad de los ítems, no se documenta partición de personajes, validación cruzada ni etiquetas humanas independientes, y la prueba de adjetivos carece de lista, tamaños muestrales, AUC numéricas, controles léxicos, negación o plantillas alternativas. La evaluación causal es más estrecha que el título. Se inyecta una dirección en el último token de entrada a través de todas las capas, con |alpha| hasta 0,4 porque valores mayores producen texto incoherente. La tarea cuantitativa publicada solo examina Extraversion: el modelo debe elegir exactamente cinco de diez frases, cinco extravertidas y cinco introvertidas. Cinco frases ya pertenecen al cuestionario usado para construir las direcciones y cinco se toman de un inventario ampliado. La dirección de regresión sobre la media de entrada cambia monotónicamente la selección sin descripción adicional; las basadas en último token o SVD fallan y la media de salida es menos estable. No se informan repeticiones, intervalos ni tests. Cuando se añade una descripción de personaje, el efecto desaparece. En diez prompts abiertos, la inspección cualitativa encuentra una respuesta mínima y no usa jueces ciegos, rúbrica, métrica o análisis estadístico. Los percentiles de 300.000 respuestas humanas solo muestran que las puntuaciones sintéticas caen en un rango humano; no comprueban que coincidan con valoraciones humanas de cada personaje. Dos ejemplos en que una entidad llamada ChatGPT-5 reconoce a Tony Soprano y Lady Mary ilustran que las descripciones filtran identidad, pero no constituyen una prueba sistemática y no incluyen prompt o snapshot reproducible. La conclusión defendible es limitada: dentro de un único Llama, direcciones ajustadas a descripciones sintéticas derivadas del cuestionario correlacionan con lenguaje de rasgos explícitamente inducido y una dirección puede desplazar una tarea forzada de Extraversion en un contexto estrecho. El trabajo no demuestra una personalidad latente, un circuito causal de rasgo, generalización fuera del modelo o personajes usados, control de los cinco rasgos ni dirección robusta de conversación abierta. El PDF declara código y datos, pero el repositorio GitHub devolvía 404 y el dataset de Hugging Face 401 el 15 de julio de 2026, de modo que ambos artefactos se registran como declarados pero inaccesibles.

English

This preprint asks whether linear directions in Llama 3.3 70B activations can represent and modify the Big Five traits. The same model answers the 50-item IPIP questionnaire as 406 fictional characters and explains every answer. The authors sum ten items per trait to create five scores and concatenate the explanations into character descriptions. They then pair each description with ten Alpaca instructions and collect every-layer activations at the last input token, the mean input tokens, and the mean generated tokens. For each trait score, they average activations over all characters sharing that score and fit a linear regression per trait and layer, with SVD axes as a comparison. Supervised directions are nearly orthogonal across traits and separate positive from negative adjectives when the adjective itself is inserted literally into the system prompt. This is compatible with explicit semantic encoding, but it does not validate personality detection: labels and text come from the same model, the explanations restate item content and polarity, no character split, cross-validation, or independent human labels are documented, and the adjective test lacks a published list, sample sizes, numeric AUCs, lexical controls, negation controls, or alternative templates. The causal evaluation is narrower than the title suggests. A direction is injected at the final input token across all layers, with |alpha| capped at 0.4 because larger values produce incoherent text. The reported quantitative task tests Extraversion only: the model selects exactly five of ten statements, five extraverted and five introverted. Five statements were already used to build the directions and five came from an extended inventory. The mean-input regression direction monotonically changes selection without extra context; last-token and SVD directions fail and the mean-output direction is less stable. No repetitions, intervals, or tests are reported. Adding a character description eliminates the effect. Across ten open-ended prompts, qualitative inspection finds minimal response and uses no blinded raters, rubric, metric, or statistical analysis. Percentiles from 300,000 human responses only show that synthetic scores lie in a human range; they do not test agreement with human ratings of each character. Two examples in which an entity called ChatGPT-5 identifies Tony Soprano and Lady Mary illustrate identity leakage, but they are not a systematic test and lack a reproducible prompt or snapshot. The defensible conclusion is narrow: within one Llama model, directions fitted to synthetic questionnaire-derived descriptions correlate with explicitly induced trait language, and one direction can shift a constrained Extraversion task in a narrow context. The work does not establish latent personality, a causal trait circuit, generalization beyond the model or characters used, control of all five traits, or robust open-ended steering. The PDF declares code and data, but the GitHub repository returned 404 and the Hugging Face dataset returned 401 on 15 July 2026, so both are recorded as declared but inaccessible.

Pregunta de investigación

¿Pueden direcciones lineales aprendidas en las activaciones de Llama 3.3 70B a partir de perfiles Big Five sintéticos detectar lenguaje asociado a cada rasgo y modificar la respuesta del modelo?

Método

Llama 3.3 70B responde los 50 ítems IPIP como 406 personajes y genera una explicación por ítem. Se agregan diez respuestas por rasgo y las explicaciones forman una descripción. Cada descripción se combina con diez instrucciones Alpaca, produciendo 4.060 contextos de activación. En cada capa se extrae último token de entrada, media de entrada y media de salida. Para cada valor de puntuación se promedian las activaciones de los personajes con ese valor y se ajusta mínimos cuadrados; SVD sirve de comparación. Las direcciones se prueban con adjetivos insertados en el prompt y se inyectan en el último token de entrada de todas las capas. El control cuantitativo publicado usa diez frases de Extraversion y el análisis abierto inspecciona cualitativamente diez instrucciones.

Muestra: La muestra analítica son 406 personajes ficticios, no personas ni modelos independientes. Cada personaje genera 50 respuestas y explicaciones, para 20.300 observaciones de ítem, y se combina con diez instrucciones, para 4.060 contextos. La regresión reduce después las activaciones a promedios por valor de puntuación. Solo se estudia un checkpoint de Llama; la tarea cuantitativa de steering usa un único conjunto de diez frases de Extraversion y no se informa repetición por alpha.

Hallazgos

  • La fuente vigente comprobada es arXiv:2512.17639v2, revisada el 15 de enero de 2026, con 29 páginas y seis figuras.
  • Las 29 páginas se renderizaron e inspeccionaron visualmente.
  • El PDF vigente coincide byte a byte con la copia en caché y tiene SHA-256 2399356785fe311d88807c48dd52c8fa90caf727001a6de59c9ffe61e24c9aa0.
  • Llama 3.3 70B genera 406 perfiles a partir de 50 respuestas IPIP por personaje.
  • Las explicaciones de las respuestas se reutilizan como descripciones que condicionan las activaciones.
  • Se recogen activaciones en 4.060 combinaciones de personaje e instrucción, en todas las capas y tres posiciones de token.
  • La regresión se ajusta a activaciones promediadas entre personajes con la misma puntuación de rasgo.
  • Las direcciones de regresión de distintos rasgos son aproximadamente ortogonales en la capa ilustrada.
  • Los ejes SVD quedan casi ortogonales a las direcciones supervisadas y no producen steering sistemático.
  • Los adjetivos positivos y negativos se separan mejor en capas medias y tardías cuando el adjetivo se incluye literalmente en el prompt.
  • La inyección se aplica al último token de entrada en todas las capas y se limita empíricamente a |alpha| menor o igual que 0,4.
  • La dirección de media de entrada cambia monotónicamente una selección forzada de frases de Extraversion sin descripción adicional.
  • La dirección de media de salida es menos fiable; último token y SVD no logran un cambio completo o sistemático.
  • Al añadir una descripción explícita de personaje, el steering no tiene efecto observable en la tarea forzada.
  • La evaluación abierta informa una respuesta mínima al steering mediante inspección cualitativa.
  • Cinco de las diez frases de la tarea forzada ya aparecen en el cuestionario que construyó la dirección.
  • Las puntuaciones sintéticas caen dentro de percentiles humanos, sin comprobar concordancia personaje a personaje.
  • El apéndice muestra dos descripciones que una entidad denominada ChatGPT-5 asigna al personaje esperado con 95% de confianza declarada.
  • El paper declara código en GitHub y datos en Hugging Face.
  • El 15 de julio de 2026 el repositorio devolvía HTTP 404 y el dataset HTTP 401, por lo que no pudieron auditarse ni reproducirse.

Limitaciones

  • Las etiquetas de rasgo, las explicaciones y las activaciones proceden del mismo Llama 3.3 70B.
  • La explicación de cada ítem reexpresa su semántica, respuesta y polaridad, creando fuga directa de etiqueta hacia la descripción.
  • El estudio mide activaciones inducidas por descripciones explícitas, no la conducta sin prompt del modelo.
  • No se documenta una partición de entrenamiento y prueba por personajes.
  • No se describe validación cruzada, bootstrap o evaluación fuera de muestra para la regresión.
  • No hay etiquetas humanas independientes para las puntuaciones de los 406 personajes.
  • No se comparan las puntuaciones sintéticas con las valoraciones empíricas de personajes que la fuente OpenPsychometrics afirma ofrecer.
  • Estar dentro de un rango humano no demuestra realismo, validez ni concordancia de perfil.
  • Promediar por puntuación reduce la unidad analítica a bins y puede ocultar variación entre personajes.
  • No se informa cuántos valores de puntuación únicos alimentan cada regresión.
  • Las puntuaciones de diez ítems solo permiten como máximo 41 sumas discretas antes de considerar valores no observados.
  • La ecuación supone errores normales sin diagnóstico o justificación reportada.
  • No se publican coeficientes, R cuadrado, error de predicción o residuos de las regresiones.
  • La ortogonalidad entre pesos no prueba que cada eje corresponda causalmente a un rasgo psicológico.
  • La evaluación de adjetivos introduce literalmente el descriptor en el system prompt.
  • El ROC puede detectar semántica léxica o seguimiento de instrucciones, no personalidad generalizable.
  • No se publica la lista de adjetivos, su procedencia, balance ni número por rasgo.
  • No se reportan AUC exactas, intervalos, tests o corrección por múltiples capas y rasgos.
  • No hay controles con sinónimos, antónimos, negación, palabras neutrales, frases contradictorias o plantillas alternativas.
  • No hay prueba en personajes retenidos, otros modelos, modelos base o idiomas.
  • La intervención cuantitativa publicada evalúa solo Extraversion, no los cinco rasgos.
  • La mitad de las frases de la tarea forzada fue vista en la construcción de las direcciones.
  • El formato de elegir cinco de diez fuerza una compensación mecánica entre opciones positivas y negativas.
  • Las curvas parecen una única trayectoria por alpha sin repeticiones ni incertidumbre.
  • No se reporta seed, temperatura, top-p, max tokens, muestreo o tratamiento de respuestas inválidas.
  • No se informa la normalización de cada dirección, por lo que la escala de alpha puede no ser comparable entre métodos, rasgos o capas.
  • Valores mayores de alpha producen gibberish, señal de perturbación general además de posible control de rasgo.
  • La inyección en todas las capas impide atribuir el efecto a una capa concreta.
  • La descripción explícita anula el efecto, limitando robustez frente a contexto real.
  • La evaluación abierta no define de antemano qué cambio cuenta como Extraversion u otro rasgo.
  • No hay jueces humanos ciegos, acuerdo interevaluador, LIWC, LLM-as-judge, métrica o test estadístico en tareas abiertas.
  • Los ejemplos abiertos cambian contenido autobiográfico inventado además del estilo, lo que dificulta atribuir el efecto al rasgo.
  • Una de las diez instrucciones pide letras de Yesterday, tarea con probable rechazo o restricción de copyright que no se analiza como confusor.
  • Los dos análisis de identidad atribuidos a ChatGPT-5 son ejemplos seleccionados, no una evaluación sistemática de fuga.
  • No se identifica qué producto, snapshot o prompt corresponde a ChatGPT-5.
  • No se informa revisión exacta del checkpoint Llama, librerías, hardware, cuantización o precisión numérica.
  • No se publican tablas numéricas completas para ROC o curvas de steering.
  • No hay evaluación de capacidad, factualidad, seguridad o coherencia más allá de observar gibberish.
  • El código declarado no estaba públicamente disponible en la URL indicada durante la auditoría.
  • El dataset declarado exigía autorización o no estaba disponible públicamente durante la auditoría.
  • Sin artefactos accesibles no pueden verificarse exclusiones, parsing, promedios, regresiones o gráficas.
  • El diseño sintético no justifica afirmar que los perfiles estén grounded en psicometría humana validada.
  • Aplicar una escala humana a texto generado no establece equivalencia de constructo en un LLM.
  • El estudio es un preprint sin evidencia de revisión por pares indicada en la fuente.

Qué no demuestra

  • No establece que Llama 3.3 70B posea una personalidad estable o humana.
  • No demuestra que las direcciones sean circuitos causales de personalidad.
  • No distingue una representación de rasgo de la semántica explícita del prompt.
  • No demuestra predicción fuera de muestra en personajes retenidos.
  • No valida las puntuaciones de los personajes contra juicios humanos.
  • No demuestra control de Agreeableness, Conscientiousness, Emotional Stability u Openness.
  • No demuestra steering robusto cuando existe contexto de personaje.
  • No demuestra control fiable de generación abierta.
  • No generaliza a otros modelos, checkpoints, idiomas o interfaces.
  • No muestra que una dirección sea mejor que prompting en condiciones comparables.
  • No permite reproducir el resultado con los artefactos actualmente accesibles.
  • No evalúa seguridad o efectos secundarios del steering.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2512.17639v2, submitted 19 December 2025 and revised 15 January 2026, 29 pages and 6 figures

Fuente consultada: https://arxiv.org/abs/2512.17639

Revisión: Codex complete bilingual full-text fidelity pass, current arXiv-version reconciliation, all-page PDF visual inspection, declared-code and dataset availability checks, experimental-count reconstruction, label-leakage and validation-design audit, psychometric and causal-claim assessment; summaries written from the full paper rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • meta-llama/Llama-3.3-70B-Instruct for questionnaire generation, character descriptions, activation collection, probing and steering; exact checkpoint revision, runtime and hardware not reported
  • ChatGPT-5, as named by the appendix, for two character-identity guesses; provider, snapshot, prompt and run date not reported

Instrumentos y métricas

  • 50-item IPIP Big Five Factor Markers, ten items each for Extraversion, Emotional Stability, Agreeableness, Conscientiousness and Openness
  • Five-point Likert responses plus free-text explanation generated in character
  • Linear least-squares directions fitted to score-grouped mean activations
  • Singular-value decomposition axes as unsupervised comparison
  • Adjective-polarity projection and ROC visualization
  • Ten-item forced-choice Extraversion task, with five items seen during direction construction and five reported as unseen
  • Qualitative inspection of ten open-ended Alpaca instructions

Datos utilizados

  • 406 fictional characters selected from OpenPsychometrics Which Character Are You lists
  • 20,300 model-generated questionnaire item responses and explanations
  • 4,060 character-description and Alpaca-instruction activation contexts
  • Human percentile reference derived from 300,000 OpenPsychometrics Big Five responses
  • Ten selected instructions attributed to the tatsu-lab/alpaca dataset
  • Declared plastic-labs/personality-steering Hugging Face dataset, inaccessible with HTTP 401 on 15 July 2026

Evidencia y localización

  • Versión, fecha, extensión, modelo y contribución declarada: arXiv:2512.17639v2, title page, abstract and arXiv metadata checked 15 July 2026
  • Generación de 406 perfiles y 50 respuestas por personaje: Sections 2.1 and 3.1, pages 3 and 5; Listing 1
  • Diez instrucciones, tres posiciones y activaciones en todas las capas: Section 2.2, pages 3–4; Appendix D, page 15
  • Regresión sobre medias de personajes con igual puntuación: Section 2.3, equation 1, page 4
  • Adjetivos y ROC: Section 3.2.2 and Figure 4, page 6; Listing 4, page 13
  • Método de inyección y umbral empírico de alpha: Section 3.3.1, equation 2, page 7
  • Tarea forzada, solapamiento de cinco ítems y resultados: Section 3.3.2, Figure 5 and Listing 3, pages 7–8; Figure 6, page 15
  • Efecto nulo con descripción y señal mínima en abierto: Sections 3.3.2–3.3.3, Figures 5–6 and Appendix I, pages 7–8 and 27–29
  • Percentiles humanos y análisis de fuga de identidad: Section 3.1 and Figure 2, page 5; Appendices E–H, pages 16–24
  • Código y dataset declarados pero inaccesibles: Paper page 1 footnotes; GitHub page/API HTTP 404 and Hugging Face page/API HTTP 401 checked 15 July 2026; reports/verification/article-180-artifact-and-design-audit.json
  • Inspección visual completa: All 29 pages of arXiv:2512.17639v2 rendered and visually inspected on 15 July 2026