NPTI propone inducir polos positivos y negativos de los Big Five mediante intervención directa en activaciones FFN durante la inferencia, sin entrenar ni cambiar los pesos. PersonalityBench combina descripciones derivadas de facetas IPIP-NEO-300 con preguntas situacionales generadas sobre temas UltraChat. Para cada rasgo, Llama-3-8B-Instruct responde a las mismas preguntas bajo descripciones opuestas; se mide por coordenada la diferencia en probabilidad de que la salida SiLU del gate sea positiva y se seleccionan diferencias superiores a +10 % o inferiores a −10 %. En generación, NPTI aumenta las coordenadas del polo objetivo con una función ponderada por delta y su percentil 95 y limita a cero las del polo contrario. En la evaluación automática sobre preguntas derivadas de SocialIQA, NPTI obtiene media agregada 9,43 y varianza 0,49: iguala la media de P2, con menor varianza, y queda 0,18 puntos por debajo de LoRA SFT. Cinco jueces ordenan cinco métodos en 200 preguntas: NPTI logra el mejor rango medio global (2,27) y lidera Extraversion y Neuroticism, pero Simple Prompt, P2 y SFT lideran respectivamente Agreeableness, Conscientiousness y Openness. En Qwen supera ambos prompts en los cinco rasgos; en Mistral y Gemma lo hace solo en aproximadamente la mitad. La técnica tampoco es neutral para capacidades generales: casi todas las intervenciones reducen alguna métrica, Neuroticism+ cae hasta 7 puntos en CommonsenseQA y solo Conscientiousness+ mejora levemente las cuatro. La lectura defendible es que NPTI es un mecanismo white-box competitivo para orientar conducta textual reconocible como rasgos, no que cambie una personalidad psicológica persistente. Los artefactos refuerzan esta cautela: los diez conjuntos públicos contienen entre 10.278 y 31.790 coordenadas por polo; su unión cubre el 27,15 % de los gates FFN de Llama y el 47,48 % de esa unión aparece en dos o más rasgos. Son correlatos distribuidos y solapados, no neuronas exclusivas de personalidad. Además, el repositorio público no reproduce el paper tal como está escrito: aplica una máscara aleatoria no declarada al 90 % de las activaciones objetivo, no fija seed, ejecuta solo el polo reversed, juzga esos outputs con factores del rasgo positivo y conecta P2 a la plantilla equivocada. Omite PAS, ActAdd, SFT, resultados crudos y modelos alternativos, publica una credencial API en texto plano y fija dependencias incompatibles. Por tanto, el artículo aporta una idea técnica y evidencia comparativa relevante, pero sus afirmaciones de estabilidad, especificidad neuronal, paridad general con fine-tuning y reproducibilidad deben limitarse estrictamente al comportamiento evaluado y no justifican despliegue.
Pregunta de investigación
¿Puede localizarse y controlarse la expresión textual de los polos positivos y negativos de los Big Five identificando coordenadas FFN cuya probabilidad de activación difiere bajo descripciones opuestas, y puede esa intervención competir con prompting, activation addition y LoRA SFT sin modificar los pesos?