Este artículo largo de EACL 2026 propone Activation-Space Personality Steering, un método de intervención en activaciones para desplazar la expresión textual de cinco etiquetas OCEAN sin modificar los pesos del modelo. La revisión usa la versión definitiva de ACL Anthology, no el registro arXiv de 2025, e inspecciona visualmente sus 16 páginas. El método produce separaciones High–Low visibles en las puntuaciones publicadas, pero la evidencia no respalda varias afirmaciones más amplias del abstract sobre un subespacio psicológico compartido, estabilidad, interpretabilidad o ausencia de impacto en capacidades.
Para cada rasgo, el estudio toma ejemplos High/Low de Big5-Chat, extrae el último estado residual no-padding por capa, calcula diferencias normalizadas de medias y agrega capas con pesos no negativos cuyo aprendizaje no se especifica. Los cinco vectores agregados se proyectan mediante PCA sobre tres componentes. Una capa offline por rasgo se elige combinando cambio L2, KL y flip del token; una capa dinámica por prompt maximiza el cambio de logits. La intervención mezcla ambas capas con pesos heurísticos 0,8/0,2, calibra la polaridad con prompts etiquetados e inyecta una dirección escalada en cada paso de decodificación. La intensidad α se barre empíricamente entre 4 y 12 y se elige para que una supuesta puntuación de fluidez no baje de 3,5.
Se evalúan Llama-3-8B-Instruct, Ministral-8B-Instruct-2410, Mistral-Small-24B-Instruct-2501, Qwen2.5-14B-Instruct y Gemma-3-4B-IT con temperatura 0,4, top-p 0,95, top-k 50 y repetition penalty 1,1. Un juez GPT no identificado puntúa rasgo y “fluidez” sobre preguntas tipo BFI y escenarios derivados de SocialIQA; no se publican modelo del juez, número de prompts, repeticiones, incertidumbre, acuerdo humano o tests. Las diferencias High–Low derivadas de la Tabla 1 son 1,0–3,5 puntos en la escala 1–5. Para Llama, el promedio es 2,64; en la ablación publicada, hybrid supera a offline-only y dynamic-only, también con 2,64 frente a 1,47 y 0,98. Esto muestra control sobre el criterio del juez en esos prompts, no que el modelo haya adquirido personalidad humana estable.
La validación de baja dimensión usa solo cinco observaciones-vector por modelo: una por rasgo. Tres componentes explican 96,31% en Llama, 96,35% en Ministral-8B, 95,91% en Mistral-24B y 93,37% en Qwen. Por tanto, el dato publicado es “más de 90%”, no “más de 95%” para todos; Gemma se omite de esa tabla. No hay comparación con vectores sin PCA, otros rangos, labels permutados o una base aleatoria. Que tres componentes resuman cinco vectores construidos con etiquetas sintéticas relacionadas no demuestra que la personalidad ocupe un subespacio psicológico intrínseco ni que la geometría sea causal, estable o generalizable. El artículo también dice soportar composición multi-rasgo, pero los experimentos puntúan cada rasgo de forma individual.
La evidencia de preservación de calidad es especialmente débil. El apéndice publica un FLUENCY_TEMPLATE que pide evaluar cuánto refleja la respuesta el rasgo OCEAN y reutiliza sus factores; no define gramática, coherencia, naturalidad o relevancia. Sin código, no puede saberse si las tablas usaron otro prompt, pero el instrumento publicado no valida fluidez. Además, la “varianza” de la Tabla 1 se calcula explícitamente entre las tres condiciones High/Base/Low, no entre ejecuciones, y por eso no mide estabilidad; aun así el texto la interpreta como consistencia entre runs. α se selecciona usando ese mismo umbral de evaluación, de modo que la preservación de fluidez también está condicionada por selección.
Las tablas de conocimiento contradicen “sin impacto”. En Llama, algunas condiciones reducen MMLU 2,21 puntos y ARC 6; en Ministral-8B, las caídas llegan a 5,42 y 9; en Gemma, a 3,90 y 6. No se evalúan capacidades en Mistral-24B o Qwen. La Tabla 4 de Ministral contiene deltas aritméticamente inconsistentes: por ejemplo, 72,02 a 67,50 equivale a −4,52 puntos, no −5,05. Los 11 temas de MMLU no se identifican, no se explica la agregación, y ARC se limita a 500 preguntas. Tampoco se evalúan toxicidad, sesgo, desinformación, seguimiento de instrucciones o seguridad, aunque manipular activaciones puede afectar esos comportamientos.
En suma, el artículo aporta una arquitectura plausible y evidencia descriptiva de que direcciones construidas con Big5-Chat pueden polarizar texto de cinco modelos bajo un juez afín a esas mismas etiquetas. No demuestra todavía steering robusto, interpretable o seguro: faltan código, artefactos, tamaños de evaluación, juez versionado, baselines ejecutados en el mismo protocolo, validación humana, tests, repeticiones y evaluación fuera de distribución. El resultado debe presentarse como control experimental de expresión textual High/Low, no como manipulación validada de personalidad ni como sistema listo para personalización real.