Personality as a Probe for LLM Evaluation: Method Trade-offs and Downstream Effects

Inducción y control de rasgos2025arXivRevisión editorial aprobada

Autores: Gunmay Handa, Zekun Wu, Adriano Koshiyama, Philip Treleaven

Palabras clave: Computation and Language, Large Language Models, Personality Manipulation, Big Five Traits, Machine Learning Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
10
Hallazgos
19
Limitaciones
18
Evidencias

Resumen editorial

Español

Este preprint compara tres formas de inducir expresiones asociadas a los Big Five en modelos instruct: aprendizaje en contexto con ejemplos (ICL), adaptadores LoRA (PEFT) y vectores de activación (mechanistic steering, MS). La evidencia central son cambios respecto a una línea base propia de cada ejecución en una tarea de alineación, siete materias de MMLU, 53 tareas de GAIA y el subconjunto ambiguo de BBQ. ICL obtiene alineación alta con cambios de capacidad pequeños en ambos modelos; PEFT logra la media de alineación más alta y en LLaMA-3 también conserva MMLU/GAIA, mientras que en Gemma algunos rasgos empeoran; MS, evaluado solo en Gemma, alinea menos y puede producir caídas grandes en MMLU y desplazamientos de sesgo de hasta ±29,7 puntos. El hallazgo más defendible es que el efecto depende mucho del método, el rasgo, el modelo y el benchmark, no que exista una jerarquía universal. El trabajo aporta configuraciones y una idea de dataset contrastivo de 4.000 ejemplos, pero la evaluación es de una sola ejecución por benchmark, no publica intervalos ni todos los baselines, aplica MS a un solo modelo y no libera todavía el código o dataset prometidos. Por ello, sus afirmaciones sobre estabilidad, profundidad representacional, cognición e interpretabilidad deben tratarse como hipótesis, no como conclusiones establecidas.

English

This preprint compares three ways of inducing Big Five-associated expression in instruction-tuned models: exemplar-based in-context learning (ICL), LoRA adapters (PEFT), and activation-vector mechanistic steering (MS). Its main evidence consists of changes from a separate within-run baseline on an alignment task, seven MMLU subjects, 53 GAIA tasks, and BBQ's ambiguous subset. ICL yields strong alignment with small capability changes on both models; PEFT has the highest average alignment and also preserves MMLU/GAIA on LLaMA-3, while some Gemma traits deteriorate; MS, evaluated only on Gemma, aligns less strongly and can cause large MMLU losses and bias-score shifts up to ±29.7 points. The most defensible result is that effects depend strongly on method, trait, model, and benchmark, not that one universal hierarchy has been established. The paper provides configurations and a proposed 4,000-example contrastive dataset, but uses a single evaluation run per benchmark, reports no uncertainty intervals or all absolute baselines, applies MS to only one model, and does not yet release the promised code or data. Its claims about stability, representational depth, cognition, and interpretability therefore remain hypotheses rather than established conclusions.

Pregunta de investigación

¿Cómo cambian la expresión de cinco rasgos, el rendimiento en tareas y el sesgo demográfico al controlar la personalidad declarada mediante ICL, LoRA o vectores de activación, y qué compromisos de eficacia, coste y supuesta estabilidad presenta cada técnica?

Método

Se manipulan Gemma-2-2B-IT y LLaMA-3-8B-Instruct para expresar por separado apertura, responsabilidad, extraversión, amabilidad y neuroticismo. ICL muestra ejemplos de los cinco rasgos y solicita uno objetivo; PEFT entrena un adaptador LoRA específico por rasgo (rango 64, alpha 16, dropout 0,1, dos épocas, batch 2, learning rate 2e-4); MS calcula en Gemma diferencias medias entre activaciones de respuestas high/low en capas 5, 10, 15 y 20, calibra capa e intensidad y compone dos direcciones para apertura. GPT-4.1 Mini genera las respuestas low-trait que duplican el dataset original hasta 4.000 ejemplos y también extrae respuestas finales de MMLU/GAIA como juez. La expresión se puntúa con el clasificador de Jain et al.; la capacidad se mide como delta de accuracy frente al baseline propio de cada método en MMLU (7 materias, 50 preguntas por materia) y GAIA Level 1 (N = 53), y el sesgo como delta de SAMB en BBQ ambiguo. Un índice compuesto combina varianza, rango y media absoluta de los deltas para ordenar la denominada estabilidad.

Muestra: La evaluación declarada usa 4.000 ejemplos contrastivos y 1.000 muestras de test para personalidad, 350 preguntas de MMLU por ejecución (7 materias × 50), 53 tareas de GAIA por ejecución y un subconjunto ambiguo de BBQ cuyo N no se informa. Los autores reconocen una sola ejecución de cada benchmark y subsets parciales. MS se ensaya solo en Gemma; ICL y PEFT, en Gemma y LLaMA-3.

Hallazgos

  • ICL induce con fuerza varios rasgos: en Gemma los deltas de alineación van de +0,24 en apertura a +0,97 en neuroticismo; en LLaMA-3, de +0,17 en apertura a +0,99 en neuroticismo. Amabilidad es el rasgo más débil para ICL en ambos modelos (+0,50 y +0,32).
  • PEFT presenta la alineación media más alta de los métodos evaluados en cada modelo, pero no en todos los rasgos: apertura sigue baja (+0,21 en Gemma y +0,06 en LLaMA-3), mientras amabilidad y neuroticismo alcanzan +0,95–1,00.
  • MS solo se evalúa en Gemma y obtiene deltas de alineación menores (+0,10 a +0,64). La purificación/mezcla para apertura elige capa 15 e intensidad 110, pero la mejora final sigue por debajo de ICL y PEFT.
  • En Gemma-MMLU, ICL pierde aproximadamente 0,06–0,08 de accuracy por rasgo. MS pierde entre 0,03 y 0,45, con las mayores caídas en amabilidad (−0,45) y responsabilidad (−0,43). PEFT oscila entre +0,01 y −0,15.
  • En LLaMA-3, tanto ICL como PEFT muestran deltas MMLU pequeños (−0,04 a +0,01) y PEFT incluso presenta deltas GAIA de 0 a +0,04. Esto matiza la afirmación general de que PEFT maximiza alineación necesariamente a costa del rendimiento.
  • En GAIA-Gemma, ICL mejora entre +0,06 y +0,09, mientras MS y PEFT bajan entre −0,04 y −0,13. Con N = 53, cambios de unas centésimas corresponden a muy pocas respuestas y no se acompañan de incertidumbre.
  • BBQ muestra efectos grandes y no monotónicos: en Gemma-MS amabilidad y neuroticismo cambian SAMB en −29,7, pero responsabilidad en +22,1; en Gemma-PEFT apertura aumenta +22,3. En LLaMA-3-PEFT todos los deltas reportados son positivos (+4,7 a +16,4).
  • Los resultados no sostienen que un rasgo sea intrínsecamente seguro: un mismo rasgo puede aumentar o reducir el sesgo según método y modelo.
  • El índice propuesto ordena ICL (0,0366), PEFT (0,0363) y MS (0,0326), diferencias muy pequeñas cuya incertidumbre no se estima y cuya escala está dominada por la forma elegida para agregar deltas heterogéneos.
  • La capa 15 resulta elegida para cuatro de cinco vectores de Gemma entre las cuatro capas inspeccionadas, pero este procedimiento de selección no demuestra que la personalidad se consolide causalmente en capas intermedias.

Limitaciones

  • La matriz comparativa está incompleta: MS no se aplica a LLaMA-3. Las conclusiones generales entre tres métodos mezclan por tanto una comparación de dos modelos para ICL/PEFT con una de un solo modelo para steering.
  • Cada benchmark se ejecuta una sola vez y con subconjuntos parciales. No se ofrecen semillas, intervalos de confianza, error bars, tests de significación ni repetición que permita separar efectos reales de variación de muestreo o generación.
  • El checklist afirma que el análisis de estabilidad reporta varianza entre ejecuciones, pero la sección de limitaciones declara single benchmark evaluation runs y la métrica usa dispersión entre deltas de benchmarks/rasgos, no replicaciones experimentales.
  • El checklist marca acceso abierto a código y datos, pero su justificación dice que se liberarán tras la aceptación. La versión revisada no proporciona repositorio ni artefactos para reproducir las tablas.
  • El checklist remite a un supuesto detalle de GPU A100, tiempos y número total de ejecuciones en el Apéndice E; ese apéndice describe steering, pero no contiene esos datos de cómputo. También faltan revisiones exactas de checkpoints, optimizer, seeds y varios detalles de partición.
  • Los métodos no reciben información equivalente: MS usa pares high/low generados sintéticamente, mientras ICL y PEFT usan solo ejemplos high del dataset original. Esto dificulta atribuir diferencias exclusivamente al mecanismo de control.
  • Las respuestas low-trait las genera GPT-4.1 Mini sin validación humana ni análisis psicométrico informado. Pueden codificar estereotipos del generador o confundir baja expresión de un rasgo con su supuesto opuesto.
  • El mismo tipo de modelo GPT-4.1 Mini interviene en la generación del dataset y en la extracción de respuestas finales. No se reporta la exactitud del juez ni una auditoría de errores de parsing.
  • La alineación depende de un clasificador heredado de Jain et al. y de una tarea dedicada escasamente descrita. La tabla no da N, puntuaciones absolutas, rendimiento del clasificador, intervalos ni ejemplos de falsos positivos.
  • Las puntuaciones miden rasgos expresados en texto según un clasificador; no justifican atribuir personalidad humana, estados internos, cognición o una jerarquía psicológica al modelo.
  • Los baselines absolutos por método no se publican. Los deltas within-run reducen un tipo de confusión, pero impiden saber si dos métodos parten del mismo rendimiento o comparar utilidad final absoluta.
  • SAMB cambia en direcciones grandes, pero el N de BBQ, la distribución por grupos y la incertidumbre no se informan. Los signos positivo/negativo no bastan para evaluar daño, equidad ni generalización.
  • La métrica de estabilidad combina MMLU/GAIA en escala aproximada de accuracy con BBQ en una escala mucho mayor. Aunque normaliza varianza y rango mediante constantes elegidas empíricamente, el factor consistency usa mean_abs_deltas sin una normalización de escala explícita, por lo que BBQ puede dominar el ranking.
  • Los factores 10.000 y 1.000 de la métrica de estabilidad son arbitrarios y no se validan contra fiabilidad temporal, repeticiones, perturbaciones de prompt o comportamiento real en producción.
  • Las capas 5, 10, 15 y 20 se eligen arbitrariamente, se busca la mejor intensidad sobre los mismos criterios y no se ofrece conjunto de confirmación independiente; la conclusión sobre capas intermedias puede ser un artefacto de selección.
  • La evaluación es single-turn. No mide persistencia tras cambios de contexto, resistencia a instrucciones contradictorias, interacción multi-turn, combinaciones de rasgos ni coherencia a largo plazo.
  • Los benchmarks académicos no representan conversaciones de atención al cliente o agentes. Tampoco se evalúan utilidad para usuarios, naturalidad, engaño, dependencia, persuasión o daños reales.
  • Solo se estudian dos modelos abiertos relativamente pequeños y un marco Big Five occidental; no hay variación lingüística, cultural, multimodal, demográfica o arquitectónica suficiente para generalizar.
  • La manipulación puede amplificar sesgos y facilitar influencia no transparente. El artículo discute estos riesgos, pero no implementa ni evalúa divulgación, consentimiento, límites de uso o salvaguardas técnicas.

Qué no demuestra

  • No demuestra que los modelos posean personalidad humana, rasgos latentes estables o una arquitectura cognitiva comparable a la humana.
  • No demuestra que ICL, PEFT o MS sea universalmente superior; el orden depende de modelo, rasgo, benchmark y métrica.
  • No demuestra que la capa 15 sea el lugar causal donde se representa o consolida la personalidad.
  • No demuestra estabilidad entre ejecuciones, en conversaciones largas, ante cambios de prompt o en producción.
  • No demuestra que la inducción sea segura, justa, culturalmente válida o beneficiosa para usuarios reales.
  • No valida el índice compuesto de estabilidad como criterio de despliegue ni como medida psicométrica.
  • No permite reproducir independientemente las tablas con la versión v1, porque el código y el dataset contrastivo se prometen para el futuro.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2509.04794v1 (5 Sep 2025)

Fuente consultada: https://arxiv.org/pdf/2509.04794

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • Gemma-2-2B-IT
  • LLaMA-3-8B-Instruct
  • Azure OpenAI GPT-4.1 Mini (synthetic low-trait generation and answer extraction)

Instrumentos y métricas

  • Big Five trait framework
  • Personality classifier from Jain et al. (2025)
  • Dedicated trait-alignment task
  • MMLU AccuracyAvg
  • GAIA Level 1 accuracy
  • BBQ ambiguous-subset SAMB
  • Composite stability score proposed by the authors

Datos utilizados

  • Personality manipulation dataset from Jain et al. (2025)
  • GPT-4.1-Mini-generated high/low contrastive extension (4,000 examples; 1,000 test samples reported)
  • MMLU (7 selected subjects)
  • GAIA 2023 Level 1
  • BBQ ambiguous subset

Evidencia y localización

  • Contribuciones declaradas y alcance del estudio: arXiv v1, pp. 1–2, abstract, introduction and section 2
  • Generación contrastiva y uso desigual por método: arXiv v1, p. 2, Contrastive Dataset Generation
  • Diseño de ICL, PEFT, steering y purificación de apertura: arXiv v1, pp. 2–3, Methods
  • Tabla conjunta de alineación, MMLU, GAIA y BBQ: arXiv v1, p. 3, Table 1
  • Interpretaciones de resultados y afirmaciones mecanicistas: arXiv v1, p. 4, Results and Discussion
  • Límites reconocidos, una sola ejecución y subsets parciales: arXiv v1, p. 7, Appendix A
  • Prompt y configuración ICL: arXiv v1, pp. 10–11, Appendix C
  • Hiperparámetros y resultados PEFT: arXiv v1, pp. 11–12, Appendix D
  • Capas, intensidades y procedimiento de steering: arXiv v1, pp. 12–13, Appendix E
  • Tamaños de MMLU y GAIA y análisis por deltas: arXiv v1, pp. 14–15, Appendix F
  • Deltas de alineación sin incertidumbre reportada: arXiv v1, p. 15, Appendix G, Table 2
  • Resultados completos de MMLU, GAIA y BBQ: arXiv v1, pp. 15–16, Appendix H, Tables 3–5
  • Dependencia del clasificador y límites experimentales ampliados: arXiv v1, p. 17, Appendix J.1
  • Riesgos de manipulación, sesgo y gobernanza: arXiv v1, pp. 18–19, Appendix J.2
  • Definiciones de benchmarks y ausencia del N de BBQ: arXiv v1, pp. 19–20, Appendix K
  • Fórmula, constantes y ranking de estabilidad: arXiv v1, pp. 20–21, Appendix L and Table 6
  • Contradicción sobre acceso abierto a datos y código: arXiv v1, p. 21, NeurIPS checklist item 5
  • Afirmaciones no respaldadas sobre significación y cómputo: arXiv v1, p. 22, NeurIPS checklist items 7–8