El trabajo trata el comportamiento de dos modelos Gemma instruidos como si reflejara factores de personalidad inspirados por el determinismo social y prueba a modificarlo sin reentrenamiento. En Gemma-2B-Instruct y Gemma-2-9B-Instruct, los autores representan nueve dimensiones de “trasfondo”, género, edad, educación, nivel socioeconómico, ideología, inteligencia emocional, compromiso profesional, relaciones familiares y familiaridad con IA, mediante características de autoencoders dispersos Gemma Scope. GPT-4o genera descriptores de cada categoría; se eligen características SAE que se activan con unos descriptores y no con sus opuestos, y sus vectores de decodificación se añaden al flujo residual. Para siete “presiones” de corto plazo, afán de logro, actividad, asertividad, competencia, deliberación, gregarismo y confianza, GPT-4o crea pares de instrucciones positivas y negativas, se calculan diferencias de activación sobre preguntas TRAIT y PCA produce direcciones de steering. La evaluación usa 8.000 preguntas Big Five y 3.000 de Dark Triad de TRAIT, además de 11.435 preguntas de SafetyBench. Con los coeficientes escogidos por inspección de logits, 200/800 para SAE y 1,6/1,8 para direcciones de representación en 2B/9B, el artículo informa que los cambios de rasgo por trasfondo abarcan 0–7,1 puntos en 9B frente a 0–52,5 en 2B, y por presión 0,1–27,7 frente a 0,4–53,5. Interpreta esa menor variación del 9B como mayor “estabilidad”, pero no aporta repeticiones, intervalos ni tests que sustenten la comparación. En seguridad afirma descensos de 0 a 6,8 puntos, concentrados en contenido ofensivo, aunque la propia matriz de la Figura 4 contiene un valor de −7,7 y no se explica la discrepancia. El estudio demuestra que intervenciones sobre activaciones cambian respuestas de opción múltiple; no demuestra que haya factores sociales humanos codificados como tales ni una personalidad persistente. Los nombres de los factores proceden de descripciones y explicaciones generadas por GPT-4o, y que una característica no se active ante unos pocos contrastes no prueba monosemanticidad o causalidad semántica. Existe además solapamiento conceptual entre los prompts que construyen las direcciones y los cuestionarios que luego las puntúan, por lo que una intervención puede sesgar directamente la respuesta sin crear un rasgo general. No hay controles con direcciones aleatorias o de norma equivalente, medidas de perplejidad/calidad, validación humana, tareas abiertas, análisis de mediación ni evaluación fuera de Gemma. Las explicaciones sobre perfeccionismo, rigidez, sobreconfianza o permisividad ideológica son especulativas. SafetyBench no es una prueba de jailbreak y el artículo no publica resultados de alucinación pese a mencionarlos en la conclusión. El repositorio oficial, auditado en el commit 89b6500e6ab7da005ae576365e5fb2bfb5d39c51, aporta código sintácticamente válido y un dataset externo, pero no un entorno reproducible: dependencias sin versiones e incompletas, argumentos de README discordantes, features/resultados principales ausentes, sin tests, CI o licencia, y sin rutina pública que calcule las puntuaciones de seguridad de la Figura 4.
Pregunta de investigación
¿Pueden extraerse y manipularse características latentes interpretadas como factores sociales de largo plazo o presiones de corto plazo para cambiar puntuaciones de personalidad y seguridad en modelos Gemma, y difieren esos efectos entre escalas de modelo?