Este artículo aceptado como póster en ICLR 2026 propone localizar y conservar subconjuntos dispersos de pesos que favorezcan una persona o conducta. Usa estadísticas de activación sobre pequeños conjuntos de calibración y variantes inspiradas en Wanda y SparseGPT; para pares opuestos añade una selección contrastiva. Evalúa Llama-2-13B, Llama-3-8B y, en parte, Qwen2.5-14B con cuestionarios MBTI, preferencias de búsqueda de poder o riqueza, identificación de alucinaciones y preguntas de RoleAgentBench. Las máscaras suelen superar a Prompt y RAG en los resultados publicados, pero SFT supera a todas las variantes de poda en las seis comparaciones de AI Persona de Table 4. Además, el conjunto de tareas no mide un único constructo psicológico: el propio apéndice reconoce que MBTI no es una prueba psicométrica validada; identificar alucinaciones es una capacidad, y emular personajes o maximizar riqueza son conductas distintas. La evidencia pública tampoco reproduce la afirmación central. El repositorio tiene trece archivos y no contiene las canalizaciones de MBTI, RoleAgent, MMLU, HellaSwag, Qwen, SFT o RAG ni resultados o tests. En la evaluación liberada, la máscara siempre se combina con un prompt explícito de la persona, por lo que no se prueba control sin contexto externo. La función denominada SparseGPT carga datos de calibración pero no los usa para puntuar pesos y produce la misma máscara para seek y reject. La implementación contrastiva Sparse usa una única diferencia absoluta y asigna el top-k a una persona y el siguiente conjunto disjunto a la otra, no la comparación direccional descrita en la ecuación del artículo. Las máscaras se aplican sobre capas densas sin kernel disperso ni medidas de latencia, de modo que tampoco se demuestra ahorro de inferencia. Por último, la degradación general declarada como <=1,6 % es incorrecta: Sparse baja HellaSwag de 0,675 a 0,653, es decir, 2,2 puntos porcentuales. La lectura defendible es que la poda guiada puede modificar respuestas conductuales en estos benchmarks, pero el artefacto actual no permite reproducir los resultados ni demostrar subnetworks naturales de personalidad, causalidad mecanística, eficiencia real, fiabilidad estadística o seguridad.
Pregunta de investigación
¿Contienen los LLM subconjuntos dispersos de parámetros especializados en personas o conductas que puedan identificarse con datos de calibración y aislarse mediante poda, sin entrenamiento adicional?