The Geometry of Persona: Disentangling Personality from Reasoning in Large Language Models

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Zhixiang Wang

Palabras clave: Computer science, Representation (politics), Artificial intelligence, Probabilistic logic, Personality

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

1
Autores
6
Hallazgos
8
Limitaciones
8
Evidencias

Resumen editorial

Español

Este preprint presenta Soul Engine, un sistema de sondeo y steering entrenado sobre Qwen2.5-0.5B-Instruct para predecir etiquetas OCEAN de personajes y modificar activaciones hacia una persona objetivo. SoulBench se describe como corpus de frases por personaje, pero el artículo no identifica sus fuentes, personajes, número de ejemplos de entrenamiento, licencias ni criterios de partición. En cada iteración concatena tres frases aleatorias del mismo personaje para que el modelo aprenda regularidades de estilo. Las supuestas etiquetas psicológicas no proceden de personas ni de un inventario: Doubao-Seed-1.6 las genera a partir del perfil completo del personaje. El modelo base tiene 24 capas y 896 dimensiones. Se congelan las capas 0–19, pero se ajustan las capas 20–23 y normalizaciones, por lo que es incorrecta la afirmación del abstract de que no se modifican los pesos del backbone. Dos cabezas reciben la representación final: una MLP de identidad de 256 dimensiones entrenada con InfoNCE y una proyección lineal de cinco salidas entrenada con MSE contra las etiquetas del teacher. Una regularización fuerza ortogonalidad entre direcciones de la cabeza OCEAN; por ello la ortogonalidad es una propiedad impuesta por el objetivo, no un fenómeno descubierto espontáneamente. Tampoco se fuerza ni mide ortogonalidad entre personalidad, identidad y circuitos de razonamiento. Sobre 1.000 ejemplos de validación, la mejor MSE es 0,0113 y la final 0,0118. El texto convierte 0,0113 en «≈99 % accuracy», pero MSE y exactitud no son métricas intercambiables, y no ofrece MAE, R², correlaciones, calibración, baselines, intervalos ni resultados por rasgo o personaje. Además, la contribución anuncia MSE < 0,01, que la tabla no alcanza. Un t-SNE de los mismos 1.000 embeddings, coloreado solo por la etiqueta de Openness del teacher, muestra dos agrupaciones visuales; t-SNE no prueba ortogonalidad, continuidad global, separación de los cinco rasgos ni independencia respecto al razonamiento. Para steering, el vector es la diferencia normalizada entre la media de una persona objetivo y una media neutral, sumada al residual con intensidad α. Aunque el método formula intervención en la capa L−1, la ablación recorre capas 10–20 y declara un óptimo 14–16 con boost 6–8. Las métricas «Villainy» y «Sanity» de los heatmaps no se definen, no tienen muestra, evaluador, repeticiones o incertidumbre, y el caption confunde color oscuro con mayor adherencia aunque la leyenda de Villainy usa tonos rojos para valores altos. No hay generaciones de ejemplo, comparación con prompting/SFT/LoRA, prueba en perfiles nuevos ni evaluación humana. Sobre todo, no se ejecuta ningún benchmark de razonamiento o inteligencia; por tanto, las afirmaciones de «alineamiento sin impuesto», «inteligencia original mantenida» y subespacios distintos de razonamiento no están probadas. El estudio es una demostración preliminar en un único modelo de 0,5B con etiquetas de otro LLM. Aporta una arquitectura posible y un error de regresión interno, pero no valida personalidad psicológica, control determinista, preservación de capacidades ni seguridad. El «Safety Interceptor» y la sustracción de vectores maliciosos son trabajo futuro, no resultados.

English

This preprint presents Soul Engine, a probing and steering system trained on Qwen2.5-0.5B-Instruct to predict character-level OCEAN labels and alter activations toward a target persona. SoulBench is described as a corpus of sentences grouped by character, but the paper does not identify its sources, characters, training-set size, licenses, or split criteria. Each iteration concatenates three random sentences from one character to encourage stylistic invariance. The alleged psychological ground truth does not come from people or an inventory: Doubao-Seed-1.6 generates the labels from full character profiles. The 24-layer, 896-dimensional base model freezes layers 0–19 but fine-tunes layers 20–23 and normalization components, so the abstract's claim that backbone weights are not modified is incorrect. Two heads consume the final representation: a 256-dimensional identity MLP trained with InfoNCE and a five-output linear probe trained by MSE against teacher labels. A regularizer forces orthogonality among directions in the OCEAN head; orthogonality is therefore imposed by the objective rather than discovered spontaneously. Nor does the loss enforce or measure orthogonality between personality, identity, and reasoning circuits. On 1,000 validation examples, the best MSE is .0113 and final MSE .0118. The paper translates .0113 into “≈99% accuracy,” but MSE and accuracy are not interchangeable, and it reports no MAE, R², correlations, calibration, baselines, intervals, or per-trait or per-character results. Its contribution section also promises MSE < .01, which the table does not reach. A t-SNE of the same 1,000 embeddings, coloured only by teacher-labelled Openness, shows two visual groupings; t-SNE cannot establish orthogonality, global continuity, separation of all five traits, or independence from reasoning. For steering, a normalized vector between target-persona and neutral means is added to the residual stream with strength α. Although the method defines intervention at layer L−1, the ablation scans layers 10–20 and calls layers 14–16 with boost 6–8 optimal. The heatmap metrics “Villainy” and “Sanity” are undefined, with no sample, evaluator, repetitions, or uncertainty, and the caption confuses dark colour with greater adherence even though high Villainy is shown in red. No generation examples, prompting/SFT/LoRA comparisons, new-profile tests, or human evaluations are provided. Most importantly, no reasoning or intelligence benchmark is run, so claims of zero alignment tax, preserved original intelligence, and a subspace distinct from reasoning are untested. This is a preliminary demonstration on one 0.5B model using labels from another LLM. It contributes a possible architecture and an internal regression error, but does not validate psychological personality, deterministic control, capability preservation, or safety. The proposed “Safety Interceptor” and subtraction of malicious vectors remain future work.

Pregunta de investigación

¿Puede un encoder parcialmente ajustado aprender de etiquetas OCEAN generadas por un teacher, separar representaciones estilísticas y permitir steering por diferencias de activación sin degradar las capacidades generales del modelo?

Método

SoulBench concatena dinámicamente tres frases del mismo personaje y usa etiquetas OCEAN generadas por Doubao-Seed-1.6. En Qwen2.5-0.5B-Instruct se congelan capas 0–19 y se ajustan 20–23. Una cabeza de identidad usa InfoNCE; una cabeza OCEAN usa MSE y regularización ortogonal. La validación reporta MSE sobre 1.000 ejemplos, un t-SNE de Openness y un grid de capas 10–20 e intensidades 2–15 con métricas no definidas de Villainy/Sanity.

Muestra: Un único modelo de 0,5B. La validación contiene 1.000 chunks de tres frases de personaje; el tamaño de entrenamiento, número de personajes y distribución de rasgos no se informan. El grid de steering cubre seis capas y siete boosts, pero no se declara cuántas generaciones sustentan cada celda.

Hallazgos

  • La cabeza OCEAN obtiene MSE mínima 0,0113 y final 0,0118 contra etiquetas generadas por Doubao; no es una comparación con puntuaciones psicológicas humanas.
  • El t-SNE coloreado por Openness muestra dos agrupaciones, pero no cuantifica separación y no evalúa los otros cuatro rasgos ni ortogonalidad.
  • El heatmap sitúa el mejor compromiso declarado entre Villainy y Sanity en capas 14–16 y boosts 6–8, aunque ambas métricas y su protocolo de medición no están definidos.
  • La ortogonalidad entre direcciones OCEAN se incorpora explícitamente como penalización de entrenamiento; el resultado no demuestra que estuviera presente en el modelo base.
  • Las capas superiores 20–23 sí se ajustan, en contradicción con la descripción de backbone congelado o intervención sin modificación de pesos.
  • No se informa ningún resultado de MMLU, razonamiento, sintaxis, coherencia humana, estabilidad o seguridad que sostenga preservación de inteligencia.

Limitaciones

  • SoulBench no queda auditable: faltan procedencia, composición, licencias, número de personajes, tamaño de entrenamiento, distribución de etiquetas, duplicados y definición de neutralidad.
  • Las etiquetas OCEAN proceden de un único LLM teacher y perfiles de personajes, sin cuestionario, humanos, fiabilidad, validez convergente o acuerdo entre evaluadores; «ground truth psicológico» es una denominación excesiva.
  • MSE 0,0113 no equivale a 99 % de exactitud. Sin baselines y métricas por dimensión no puede juzgarse la utilidad ni compararse con una media trivial.
  • La regularización impone ortogonalidad dentro de la cabeza psicométrica y no separa explícitamente esa cabeza de identidad o razonamiento; la conclusión de subespacios independientes no sigue del objetivo.
  • t-SNE distorsiona distancias y solo colorea Openness; una visualización 2D no confirma geometría global, causalidad ni continuidad de cinco rasgos.
  • Villainy y Sanity carecen de definición, evaluador, escala, ejemplos, repeticiones y error; el heatmap no constituye una ablación reproducible.
  • Solo se estudia Qwen2.5-0.5B y se ajustan sus últimas capas. No se prueba transferencia a 7B/70B, perfiles nuevos, idiomas, tareas o modelos no entrenados con SoulBench.
  • No hay benchmark de capacidades, baseline de prompting/SFT/LoRA, evaluación humana ni análisis de daños; el mecanismo de seguridad es puramente hipotético.

Qué no demuestra

  • No demuestra que la personalidad exista de forma natural como subespacio lineal u ortogonal en Qwen o en LLM en general; la geometría se entrena con una restricción explícita.
  • No demuestra independencia entre personalidad e inteligencia ni ausencia de alignment tax, porque no mide razonamiento antes y después.
  • No valida etiquetas OCEAN, Villainy, Sanity o personajes como constructos psicológicos humanos.
  • No prueba control determinista o estable: no reporta semillas, varianza, tasa de éxito, ejemplos ni evaluación longitudinal.
  • No demuestra intervención sin cambios de pesos, ya que el encoder ajusta las cuatro capas superiores del backbone.
  • No demuestra que el Safety Interceptor detecte o elimine intención maliciosa; es una propuesta futura y potencialmente riesgosa.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2512.07092v1; preprint under review

Fuente consultada: https://arxiv.org/pdf/2512.07092

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • Qwen2.5-0.5B-Instruct
  • Doubao-Seed-1.6 (teacher for OCEAN labels)

Instrumentos y métricas

  • Teacher-generated OCEAN labels in [0,1]
  • InfoNCE contrastive loss
  • Mean squared error psychometric regression
  • Orthogonality regularization
  • t-SNE visualization
  • Undefined Villainy and Sanity heatmap scores

Datos utilizados

  • SoulBench character-sentence corpus (sources and size not reported)

Evidencia y localización

  • Hipótesis, promesas de preservación y contribuciones: arXiv v1, pp. 1–2, Abstract and Introduction
  • SoulBench y origen de las etiquetas OCEAN: arXiv v1, p. 3, section 2.1
  • Capas realmente ajustadas y arquitectura de dos cabezas: arXiv v1, pp. 3–4, sections 2.2–2.3 and Figure 1
  • Ortogonalidad impuesta por la función de pérdida: arXiv v1, p. 4, equation 6
  • Vector de steering e inconsistencia de capa de intervención: arXiv v1, pp. 5–7, section 2.4 and Figure 3
  • MSE, muestra y conversión inválida a exactitud: arXiv v1, p. 5, sections 3.1–3.2 and Table 1
  • Alcance real del t-SNE y heatmaps: arXiv v1, pp. 6–7, Figures 2–3
  • Ausencia de prueba a escala y Safety Interceptor futuro: arXiv v1, pp. 7–8, sections 4.3–5