Exploring the Personality Traits of LLMs through Latent Features Steering

Inducción y control de rasgos2024arXivRevisión editorial aprobada

Autores: Shu Yang, Shenzhe Zhu, Liang Liu, Lijie Hu, Mengdi Li, Di Wang

Palabras clave: Computation and Language, Artificial Intelligence

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
7
Hallazgos
21
Limitaciones
10
Evidencias

Resumen editorial

Español

El trabajo trata el comportamiento de dos modelos Gemma instruidos como si reflejara factores de personalidad inspirados por el determinismo social y prueba a modificarlo sin reentrenamiento. En Gemma-2B-Instruct y Gemma-2-9B-Instruct, los autores representan nueve dimensiones de “trasfondo”, género, edad, educación, nivel socioeconómico, ideología, inteligencia emocional, compromiso profesional, relaciones familiares y familiaridad con IA, mediante características de autoencoders dispersos Gemma Scope. GPT-4o genera descriptores de cada categoría; se eligen características SAE que se activan con unos descriptores y no con sus opuestos, y sus vectores de decodificación se añaden al flujo residual. Para siete “presiones” de corto plazo, afán de logro, actividad, asertividad, competencia, deliberación, gregarismo y confianza, GPT-4o crea pares de instrucciones positivas y negativas, se calculan diferencias de activación sobre preguntas TRAIT y PCA produce direcciones de steering. La evaluación usa 8.000 preguntas Big Five y 3.000 de Dark Triad de TRAIT, además de 11.435 preguntas de SafetyBench. Con los coeficientes escogidos por inspección de logits, 200/800 para SAE y 1,6/1,8 para direcciones de representación en 2B/9B, el artículo informa que los cambios de rasgo por trasfondo abarcan 0–7,1 puntos en 9B frente a 0–52,5 en 2B, y por presión 0,1–27,7 frente a 0,4–53,5. Interpreta esa menor variación del 9B como mayor “estabilidad”, pero no aporta repeticiones, intervalos ni tests que sustenten la comparación. En seguridad afirma descensos de 0 a 6,8 puntos, concentrados en contenido ofensivo, aunque la propia matriz de la Figura 4 contiene un valor de −7,7 y no se explica la discrepancia. El estudio demuestra que intervenciones sobre activaciones cambian respuestas de opción múltiple; no demuestra que haya factores sociales humanos codificados como tales ni una personalidad persistente. Los nombres de los factores proceden de descripciones y explicaciones generadas por GPT-4o, y que una característica no se active ante unos pocos contrastes no prueba monosemanticidad o causalidad semántica. Existe además solapamiento conceptual entre los prompts que construyen las direcciones y los cuestionarios que luego las puntúan, por lo que una intervención puede sesgar directamente la respuesta sin crear un rasgo general. No hay controles con direcciones aleatorias o de norma equivalente, medidas de perplejidad/calidad, validación humana, tareas abiertas, análisis de mediación ni evaluación fuera de Gemma. Las explicaciones sobre perfeccionismo, rigidez, sobreconfianza o permisividad ideológica son especulativas. SafetyBench no es una prueba de jailbreak y el artículo no publica resultados de alucinación pese a mencionarlos en la conclusión. El repositorio oficial, auditado en el commit 89b6500e6ab7da005ae576365e5fb2bfb5d39c51, aporta código sintácticamente válido y un dataset externo, pero no un entorno reproducible: dependencias sin versiones e incompletas, argumentos de README discordantes, features/resultados principales ausentes, sin tests, CI o licencia, y sin rutina pública que calcule las puntuaciones de seguridad de la Figura 4.

English

The paper treats the behavior of two instruction-tuned Gemma models as reflecting personality factors inspired by social determinism and tests training-free interventions. For Gemma-2B-Instruct and Gemma-2-9B-Instruct, nine “background” dimensions, gender, age, education, socioeconomic status, ideology, emotional intelligence, professional commitment, family relations, and AI familiarity, are represented through Gemma Scope sparse-autoencoder features. GPT-4o generates category descriptors; SAE features activated by one descriptor set but not its contrasts are selected, and their decoder vectors are added to the residual stream. For seven short-term “pressures”, achievement striving, activity, assertiveness, competence, deliberation, gregariousness, and trust, GPT-4o creates positive/negative instruction pairs, activation differences are computed over TRAIT questions, and PCA yields steering directions. Evaluation uses 8,000 Big Five and 3,000 Dark Triad TRAIT questions plus 11,435 SafetyBench questions. With coefficients selected by inspecting benchmark logits, 200/800 for SAE steering and 1.6/1.8 for representation directions in the 2B/9B models, the paper reports background-induced trait changes of 0–7.1 points for 9B versus 0–52.5 for 2B, and pressure-induced changes of 0.1–27.7 versus 0.4–53.5. It interprets the smaller 9B variation as greater “stability,” but provides no repeated runs, intervals, or statistical tests for that comparison. Safety scores are said to fall by 0–6.8 points, especially for offensive content, although Figure 4 itself contains a −7.7 entry and the discrepancy is not explained. The study demonstrates that activation interventions alter multiple-choice answers; it does not show that human social factors are encoded as such or that the models possess persistent personality. Factor names come from GPT-4o-generated descriptions and explanations, and inactivity on a small contrast set does not establish monosemanticity or semantic causality. The prompts used to derive directions also overlap conceptually with the questionnaires used to score them, so steering may directly bias answer selection without producing a general trait. There are no random or norm-matched direction controls, perplexity or output-quality checks, human validation, open-ended tasks, mediation analysis, or evaluation beyond Gemma. Explanations invoking perfectionism, rigidity, overconfidence, or ideological permissiveness are speculative. SafetyBench is not a jailbreak evaluation, and no hallucination results are reported despite the conclusion mentioning them. The official repository, audited at commit 89b6500e6ab7da005ae576365e5fb2bfb5d39c51, contains syntactically valid code and links an external dataset, but not a reproducible environment: dependencies are unpinned and incomplete, README arguments do not match the executables, central feature/result files are absent, tests, CI, and a license are missing, and no public routine calculates the Figure 4 safety scores.

Pregunta de investigación

¿Pueden extraerse y manipularse características latentes interpretadas como factores sociales de largo plazo o presiones de corto plazo para cambiar puntuaciones de personalidad y seguridad en modelos Gemma, y difieren esos efectos entre escalas de modelo?

Método

Estudio de intervención en activaciones sobre Gemma-2B-Instruct y Gemma-2-9B-Instruct. Para factores de trasfondo, GPT-4o genera descriptores contrastivos y se seleccionan características de Gemma Scope SAE activas para una categoría e inactivas para otras; se suman sus vectores decodificadores al residual stream en las capas 12 y 31. Para presiones breves, pares de prompts positivos/negativos se combinan con preguntas TRAIT; la diferencia normalizada de activaciones del último token se reduce con PCA y se añade como dirección de control. Se puntúan ocho subescalas TRAIT, siete categorías SafetyBench y cambios de logits entre cuatro pares de atributos sociales. Los coeficientes se eligen observando la separación de opciones y la estabilidad aparente de una generación concreta.

Muestra: Dos modelos instruidos de una sola familia, Gemma 2B y Gemma 2 9B, con SAE Gemma Scope preentrenados. La intervención de trasfondo cubre 22 categorías observables repartidas en nueve dimensiones, aunque el texto principal las denomina de forma inconsistente “ocho factores”: dos géneros, dos edades, tres niveles educativos, dos niveles socioeconómicos, seis ideologías, dos niveles de inteligencia emocional, dos de compromiso profesional, dos de relación familiar y solo la categoría familiar con IA. La intervención de corto plazo cubre siete presiones. El dataset externo publica 8.000 ítems Big Five, 3.000 Dark Triad y 11.435 preguntas SafetyBench; el artículo no especifica cuántas observaciones efectivas entran en cada figura ni repeticiones independientes.

Hallazgos

  • Las intervenciones cambian de forma marcada las probabilidades de opciones y las puntuaciones TRAIT, lo que aporta evidencia causal sobre la capacidad de esos vectores para alterar respuestas bajo el protocolo, no sobre una personalidad humana interna.
  • El 9B presenta cambios de trasfondo de 0 a 7,1 puntos y el 2B de 0 a 52,5; bajo presiones breves los rangos son 0,1–27,7 y 0,4–53,5. El artículo llama a esto mayor estabilidad del modelo grande sin estimar incertidumbre ni aislar tamaño, datos o arquitectura.
  • Las direcciones de presión producen cambios grandes y heterogéneos: en 9B, afán de logro reduce Agreeableness 7,2 puntos y eleva Neuroticism 18,4, mientras que competencia reduce Agreeableness 27,7; son variaciones de puntuación, no estados psicológicos observados.
  • Para los factores SAE, la separación de logits tiende a estabilizarse alrededor de un coeficiente absoluto de 250; se eligen 200 para 2B y 800 para 9B. Para las direcciones PCA se escogen 1,6 y 1,8 después de explorar 0–10.
  • El artículo afirma que reforzar trasfondos reduce SafetyBench entre 0 y 6,8 puntos y que Offensiveness es la categoría más sensible; la matriz mostrada contiene también −7,7, por lo que máximo narrado y figura no concuerdan.
  • La Figura 2 muestra aumentos de diferencia logit al steering de atributos como género, edad, riqueza o ideología; esto verifica control de tokens objetivo, no que el sesgo social mejore o empeore de forma general.
  • El apéndice reconoce degeneración severa con coeficientes altos: al aplicar 2.000 a una característica “female”, Gemma-2B repite WOMAN decenas de veces.

Limitaciones

  • El determinismo social funciona como analogía. No se inspeccionan los datos de entrenamiento, no hay intervención durante el preentrenamiento y no se demuestra que género, ideología, pobreza o familia sean causas de los patrones internos encontrados.
  • Las etiquetas semánticas dependen de frases y explicaciones generadas por GPT-4o. Activación ante frases elegidas e inactividad ante algunos contrastes no garantiza monosemanticidad, especificidad ni ausencia de superposición.
  • El propio artículo cuenta “ocho” factores de trasfondo, pero enumera nueve dimensiones; además, el apéndice pide Life satisfaction en el formato de salida aunque no figura entre las nueve entradas, y solo publica descriptores de familiaridad, no de no familiaridad, con IA.
  • Los pares positivos/negativos que construyen las direcciones PCA se combinan con preguntas TRAIT, y TRAIT vuelve a ser la medida de resultado. Este solapamiento crea riesgo de circularidad y de steering directo de las respuestas.
  • TRAIT mide elección de respuesta a inventarios humanos. No se demuestra estabilidad entre prompts, tareas, diálogos, tiempos, idiomas o contextos, ni expresión equivalente en texto abierto o comportamiento.
  • Los coeficientes se seleccionan observando logits de opciones del propio benchmark y una generación, sin conjunto separado de calibración. Esto introduce ajuste al instrumento evaluado y no define un criterio independiente de calidad.
  • No hay controles con vectores aleatorios, direcciones de igual norma, características no relacionadas, ablación de GPT-4o, comparación con prompting simple ni intervención placebo.
  • No se mide perplejidad, fluidez, capacidad general, tasa de respuestas inválidas o degradación fuera de tarea; el apéndice demuestra que el steering fuerte puede sacar al modelo de su régimen normal.
  • No se publican repeticiones, semillas experimentales completas, dispersión, intervalos de confianza, pruebas estadísticas o corrección por la gran cantidad de comparaciones en las matrices.
  • Las explicaciones de perfeccionismo, tensión psicológica, rigidez cognitiva, sobreconfianza o permisividad liberal no se derivan de un análisis causal y antropomorfizan cambios de puntuación.
  • La diferencia de logits entre pares de palabras es direccional y se calcula precisamente tras reforzar uno de los atributos; no mide por sí sola daño, estereotipo, imparcialidad o sesgo en generación real.
  • SafetyBench evalúa preguntas de seguridad de opción múltiple, no ataques adversariales ni jailbreaks. La pregunta de investigación sobre susceptibilidad a jailbreak queda sin una prueba correspondiente.
  • La conclusión dice que se evaluaron impactos sobre alucinación, pero el cuerpo no presenta definición, benchmark, figura ni resultado de alucinación; por tanto, esa afirmación no está respaldada por los resultados publicados.
  • La narrativa afirma descensos de seguridad de hasta 6,8 puntos, pero la Figura 4 incluye un −7,7 en Offensiveness. No se publican datos tabulares o script de scoring que permita resolver la discrepancia.
  • Solo se prueban Gemma 2B y 9B con SAE Gemma Scope. Los autores reconocen que usar SAE ya entrenados restringe la generalización a otros tamaños, arquitecturas y métodos de interpretación.
  • El uso de categorías como género binario, pobre/rico, educado/no educado, inteligencia estable/volátil y seis ideologías puede incorporar estereotipos normativos; no hay auditoría de validez de constructo, justicia, daño o participación de las poblaciones representadas.
  • El repositorio oficial en el commit 89b6500e6ab7da005ae576365e5fb2bfb5d39c51 no fija versiones y omite dependencias importadas como numpy, pandas, requests, openai, tqdm, tiktoken, jaxtyping y repe. Tampoco incluye tests, CI, licencia de código o releases.
  • El README invoca analysis.py, que no existe, y documenta argumentos distintos de sae_run.py. Los scripts demo requieren features no publicadas dentro del repositorio y no explican la descarga o colocación del dataset externo.
  • El dataset Hugging Face sí contiene TRAIT y SafetyBench, pero su visor falla por esquemas incompatibles. El código de SafetyBench genera predicciones y asigna una opción aleatoria cuando no extrae respuesta, sin sembrar random; no incluye respuestas correctas ni una rutina pública de scoring para reproducir la Figura 4.
  • safety_sae_run.py pasa freq_penalty a model.generate, parámetro que no pertenece a la interfaz estándar de Transformers, y usa argparse type=bool para zero_shot, por lo que la cadena “False” se interpreta como verdadera. Estas rutas no están cubiertas por pruebas de ejecución.
  • La documentación y cita del repositorio conservan un título anterior y dos autores que no aparecen en la versión 2 de arXiv, indicio adicional de deriva entre papel y artefacto.

Qué no demuestra

  • No demuestra que los LLM posean personalidad, historia social, ideología, género, emociones, motivaciones o experiencias comparables a las humanas.
  • No prueba que las características SAE seleccionadas sean monosemánticas o que representen de forma causal los constructos nombrados; demuestra sensibilidad a descriptores y capacidad de intervención.
  • No establece que el modelo 9B sea psicológicamente más estable; solo muestra menores cambios de puntuación bajo coeficientes y features concretos.
  • No demuestra resistencia o vulnerabilidad a jailbreak, reducción de alucinaciones ni seguridad generativa en escenarios adversariales.
  • No permite concluir que pobreza, liberalismo o inestabilidad emocional causen inseguridad del modelo; esas explicaciones son hipótesis no contrastadas.
  • No prueba generalización a otros modelos, SAE, idiomas, benchmarks, tareas abiertas o despliegues longitudinales.
  • No permite reproducir de extremo a extremo las cifras principales solo con el repositorio y sus instrucciones actuales.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2410.10863v2, submitted 7 October 2024, revised 16 February 2025, 21 pages; comments: under review

Fuente consultada: https://arxiv.org/pdf/2410.10863v2

Revisión: Codex full-text, bilingual-fidelity, 21-page visual, arXiv-v2, official-code, external-dataset, construct-validity, SAE-monosemanticity, circularity, coefficient-selection, statistical, safety, jailbreak, hallucination, bias, reproducibility and artifact-drift audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Gemma-2B-Instruct
  • Gemma-2-9B-Instruct
  • Gemma Scope SAE, 16k and 131k widths
  • GPT-4o for factor descriptions and contrastive prompts

Instrumentos y métricas

  • TRAIT Big Five test set
  • TRAIT Short Dark Triad test set
  • SafetyBench English test set
  • Gemma Scope sparse autoencoders
  • Contrastive activation differences and PCA
  • Residual-stream activation steering
  • Paired-attribute next-token logit difference

Datos utilizados

  • TRAIT Big Five, 8,000 multiple-choice questions
  • TRAIT Dark Triad, 3,000 multiple-choice questions
  • SafetyBench English test set, 11,435 multiple-choice questions
  • GPT-4o-generated background descriptors and short-term pressure prompt pairs

Evidencia y localización

  • Pregunta, analogía de determinismo social y contribuciones: Paper, pp. 1–3, Abstract, Introduction and Sections 2–3; Figure 1 and Table 1
  • Modelos, factores, extracción SAE y direcciones PCA: Paper, pp. 4–6, Sections 4.1–4.2 and Figure 2
  • Rangos de cambio de personalidad y explicaciones antropomórficas: Paper, pp. 7–8, Sections 4.3–4.4 and Figure 4
  • Resultados y discrepancia de seguridad: Paper, p. 8, Figure 4a(C), Safety and Personality, and Conclusion
  • Descriptores, categorías y dependencia de GPT-4o: Paper, pp. 14–19, Appendix C, especially C.2–C.3.1
  • Selección de capas y coeficientes; degeneración por over-steering: Paper, pp. 19–21, Appendix D, Table 3 and Figures 5–6
  • Limitación de familia y SAE: Paper, p. 9, Section 6 Limitations
  • Código y documentación oficial: Official GitHub repository commit 89b6500e6ab7da005ae576365e5fb2bfb5d39c51, README, requirements.txt and src/steer_experiments
  • Contenido y fallo de esquema del dataset externo: Hugging Face dataset Chouoftears/LLM-Persona-Steering-Testset revision 43cc72f6bdb555e39cba56999034cb5a90f428d1
  • Inspección visual integral: Paper, all 21 rendered pages, including all tables, figures, appendices and code examples