Este preprint presenta Soul Engine, un sistema de sondeo y steering entrenado sobre Qwen2.5-0.5B-Instruct para predecir etiquetas OCEAN de personajes y modificar activaciones hacia una persona objetivo. SoulBench se describe como corpus de frases por personaje, pero el artículo no identifica sus fuentes, personajes, número de ejemplos de entrenamiento, licencias ni criterios de partición. En cada iteración concatena tres frases aleatorias del mismo personaje para que el modelo aprenda regularidades de estilo. Las supuestas etiquetas psicológicas no proceden de personas ni de un inventario: Doubao-Seed-1.6 las genera a partir del perfil completo del personaje. El modelo base tiene 24 capas y 896 dimensiones. Se congelan las capas 0–19, pero se ajustan las capas 20–23 y normalizaciones, por lo que es incorrecta la afirmación del abstract de que no se modifican los pesos del backbone. Dos cabezas reciben la representación final: una MLP de identidad de 256 dimensiones entrenada con InfoNCE y una proyección lineal de cinco salidas entrenada con MSE contra las etiquetas del teacher. Una regularización fuerza ortogonalidad entre direcciones de la cabeza OCEAN; por ello la ortogonalidad es una propiedad impuesta por el objetivo, no un fenómeno descubierto espontáneamente. Tampoco se fuerza ni mide ortogonalidad entre personalidad, identidad y circuitos de razonamiento. Sobre 1.000 ejemplos de validación, la mejor MSE es 0,0113 y la final 0,0118. El texto convierte 0,0113 en «≈99 % accuracy», pero MSE y exactitud no son métricas intercambiables, y no ofrece MAE, R², correlaciones, calibración, baselines, intervalos ni resultados por rasgo o personaje. Además, la contribución anuncia MSE < 0,01, que la tabla no alcanza. Un t-SNE de los mismos 1.000 embeddings, coloreado solo por la etiqueta de Openness del teacher, muestra dos agrupaciones visuales; t-SNE no prueba ortogonalidad, continuidad global, separación de los cinco rasgos ni independencia respecto al razonamiento. Para steering, el vector es la diferencia normalizada entre la media de una persona objetivo y una media neutral, sumada al residual con intensidad α. Aunque el método formula intervención en la capa L−1, la ablación recorre capas 10–20 y declara un óptimo 14–16 con boost 6–8. Las métricas «Villainy» y «Sanity» de los heatmaps no se definen, no tienen muestra, evaluador, repeticiones o incertidumbre, y el caption confunde color oscuro con mayor adherencia aunque la leyenda de Villainy usa tonos rojos para valores altos. No hay generaciones de ejemplo, comparación con prompting/SFT/LoRA, prueba en perfiles nuevos ni evaluación humana. Sobre todo, no se ejecuta ningún benchmark de razonamiento o inteligencia; por tanto, las afirmaciones de «alineamiento sin impuesto», «inteligencia original mantenida» y subespacios distintos de razonamiento no están probadas. El estudio es una demostración preliminar en un único modelo de 0,5B con etiquetas de otro LLM. Aporta una arquitectura posible y un error de regresión interno, pero no valida personalidad psicológica, control determinista, preservación de capacidades ni seguridad. El «Safety Interceptor» y la sustracción de vectores maliciosos son trabajo futuro, no resultados.
Pregunta de investigación
¿Puede un encoder parcialmente ajustado aprender de etiquetas OCEAN generadas por un teacher, separar representaciones estilísticas y permitir steering por diferencias de activación sin degradar las capacidades generales del modelo?