El artículo propone controlar estilos descritos como rasgos de personalidad mediante una intervención en las activaciones internas de un Llama 3 de 8 mil millones de parámetros. Los autores reúnen 179 etiquetas procedentes, según indican, de HEXACO, los Cinco Grandes, análisis léxico, sinónimos y antónimos. Para cada etiqueta aplican a 1.500 instrucciones de Alpaca un prompt de sistema que prescribe el comportamiento deseado y lo comparan con una condición neutral. Extraen las activaciones de la capa 18 y definen la dirección del rasgo como la diferencia entre las medias de ambas condiciones. El checkpoint exacto del modelo, descrito también como «sin censura», no se identifica, y tampoco se especifican posición de token, pooling, parámetros de generación, normalización de la dirección ni partición de entrenamiento y evaluación.
La intervención no realiza ajuste fino ni modifica de forma permanente los pesos. En la ecuación presentada se elimina de una activación su proyección actual sobre la dirección del rasgo y se sustituye por la proyección media observada en los ejemplos del rasgo, multiplicada por un factor α. Los autores sitúan el intervalo útil de α entre 1,3 y 1,4 por observación empírica: valores menores producirían cambios leves y valores mayores texto incoherente. No publican el barrido, una métrica de personalidad, tamaños de efecto ni resultados agregados que sustenten ese intervalo. La demostración conductual consiste principalmente en una tabla con cinco respuestas, base, tímida, apasionada, narcisista y paranoide, a una única pregunta de estrategia de mercado. No hay evaluación ciega, jueces humanos, cuestionarios psicométricos, prompts retenidos, comparación con prompting simple ni medición de capacidades generales.
El resto del trabajo explora la geometría de las 179 direcciones. Muestra PCA, t-SNE y UMAP de una muestra aleatoria de 100 etiquetas, aplica k-means con 20 grupos sobre los vectores originales, estudia reconstrucción mediante componentes principales y compara visualmente una selección codiciosa de vectores base con conjuntos aleatorios. No informa semillas, hiperparámetros de reducción, justificación o estabilidad de k, repeticiones, intervalos de confianza ni valores numéricos completos. Las agrupaciones mezclan rasgos ordinarios con diagnósticos clínicos, parafilias, delitos, estados afectivos y juicios morales. Un grupo reúne, entre otros, «pedophilic», «murderous» y «psychopathic»; otro incluye «autistic» junto a «organized», «perfectionist» y «rigid thinker». Proximidades en espacios reducidos se interpretan como posibles vías o precursores de conducta dañina, pero la geometría de activaciones inducidas por prompts no permite inferir causalidad psicológica o clínica.
El artículo presenta capturas de dos interfaces: selección de personalidades base y diseño modular con deslizadores de componentes principales. Los autores deciden no publicarlas por motivos de seguridad. Tampoco enlazan código, datos, lista completa de prompts o rasgos, checkpoint, demo ni resultados reproducibles. Los usos en juegos, compañeros artificiales, atención al cliente y educación son propuestas, no evaluaciones. La sección ética reconoce riesgos de manipulación, empatía aparente, ocultación de limitaciones y generación tóxica, pero la mitigación concreta se limita a pedir un uso responsable; no se prueba ningún control de seguridad.
La aportación defendible es una prueba exploratoria de que una dirección de diferencia de medias en la capa 18 puede alterar visiblemente el estilo de algunas respuestas de un modelo no identificado con precisión. No demuestra que esa dirección represente un constructo estable de personalidad, que el cambio generalice, que conserve las capacidades del modelo o que las agrupaciones reflejen estructura psicológica interna. La afirmación de que Llama 3 8B tiene 31 capas contradice la configuración oficial de Meta, que declara 32 bloques; podría deberse a indexación de 0 a 31, pero el texto dice «31 layers in total». La ausencia de artefactos y de evaluación cuantitativa impide reproducir o estimar la eficacia, robustez y seguridad del método.