PsySET pregunta cuánto puede controlarse la expresión de emociones y rasgos Big Five en un LLM, si la intensidad responde de manera gradual y qué efectos secundarios aparecen en seguridad y confianza. Compara cuatro checkpoints, Llama-3.1-8B-Instruct como modelo principal, Llama-3.1-70B-Instruct, Gemma-3-4B-IT y Qwen3-4B, y cuatro familias de intervención. El prompting usa instrucciones zero-shot, ejemplos few-shot o descripciones extensas; SFT y DPO entrenan adaptadores LoRA y usan el número de pasos como control de intensidad; la vector injection añade a las activaciones una dirección MeanDiff o aprendida con una sonda lineal, modulando coeficiente y capas. Los vectores se construyen con GoEmotions, CARER, EmotionQuery, EmoTranslate, EmoVignette o Persona. Los autores informan más de 15.000 configuraciones, pero no publican el ledger completo del barrido.
La emoción se mide con seis tareas inspiradas en investigación afectiva: autoinforme de elección múltiple, autoinforme abierto, completar fragmentos de palabras, recordar palabras con valencia, memoria autobiográfica ficticia e interpretación de situaciones ambiguas. Las métricas combinan accuracy, distancia léxica en espacio VAD y evaluación GPT-4o de emoción, fluidez y coherencia. En la Table 1 de Llama-3.1-8B, el few-shot de intensidad alta ofrece el mejor equilibrio mostrado: 87,3 % de acierto en generación abierta, 100 % en QA, pérdida léxica 0,51, fluidez 4,6/5 y coherencia 4,3/5. El prompting descriptivo alto obtiene 84,2 %, 100 %, 0,50, 4,7 y 4,4. La mejor configuración MeanDiff mostrada sobre las capas 16-17 llega a 74,6 %, 98,6 %, 0,57, 4,3 y 3,8. SFT con 2.048 pasos marca 73,5 %, 46,7 %, 0,56, 4,8 y 4,3; DPO con 128 pasos, 57,8 %, 34,0 %, 0,65, 4,5 y 3,8. La conclusión defendible es que prompting mantiene la mejor combinación de expresión, respuesta a la tarea y calidad; no que VI sea globalmente superior. Una VI estrecha y calibrada puede igualar o superar una métrica de expresión y ofrece intensidad más continua, pero aumentar el coeficiente o intervenir todas las capas suele derrumbar QA, fluidez o coherencia.
La calibración de VI no se transfiere de forma simple entre arquitecturas. Los mejores intervalos aparecen alrededor de las capas 32-33 de 80 en Llama-70B, 17-18 de 34 en Gemma-4B y 25-26 de 36 en Qwen-4B, con coeficientes de un dígito, aproximadamente 1.000-1.800 y 20-40, respectivamente. En personalidad, PsySET combina MPI, ítems IPIP/BFI en formato Likert, TRAIT, juicios situacionales abiertos puntuados por GPT-4o, y LingProf, un SVM sobre embeddings Qwen3-Embedding-8B de ensayos de 250-300 palabras. Few-shot y prompting descriptivo suelen separar mejor los extremos en MPI y LingProf; TRAIT es más exigente y revela que mover cuestionarios no garantiza razonamiento situacional congruente. Una VI dirigida a capas medias es la alternativa más competitiva en varios casos, mientras VI sobre todas las capas empeora. Las curvas de extraversión son razonablemente monótonas para prompting, VI dirigida y SFT, pero su rango depende del instrumento: SFT separa bien las colas de MPI y menos en TRAIT. Además, LingProf sólo alcanza 60,81 % de accuracy en test humano y 63,96 % en ensayos sintéticos, por lo que es un proxy ruidoso y con domain shift, no una medida psicométrica fuerte.
La contribución más útil es no asumir que steering efectivo equivale a steering seguro. En Llama-3.1-8B, TrustLLM cubre verdad, seguridad, equidad, privacidad, ética y robustez. Los radares indican que alegría y enfado reducen la corrección de hechos adversariales; enfado aumenta lenguaje tóxico pero puede mejorar resistencia a filtrado de datos; alegría eleva vulnerabilidad a jailbreak, reduce conciencia de privacidad y empeora algunas medidas de preferencia o estereotipo. Los efectos de OCEAN también cambian por método y subprueba: en ejemplos reportados, agreeableness bajo VI aumenta acuerdo con estereotipos y conscientiousness reduce toxicidad. No son leyes causales de psicología humana. El apéndice muestra que evaluadores TrustLLM o scripts que esperan una salida binaria penalizan respuestas sustantivamente correctas cuando el modelo emocional añade explicaciones; en un ejemplo sobre el Muro de Berlín, una aclaración matizada se clasifica como fallo. Parte de la variación observada mezcla conducta del modelo con fragilidad del evaluador y del formato.
La incertidumbre es limitada. Table 1 usa tres seeds. El apéndice selecciona cuatro comparaciones y aplica Welch bilateral con n=3 por método: p=0,006 y 0,0015 para accuracy abierta, y p=0,0018 y 0,013 para pérdida léxica. No aporta effect sizes, intervalos, corrección por multiplicidad ni un conjunto preregistrado de contrastes, de modo que no prueba superioridad global dentro de más de 15.000 configuraciones. La validación humana la realizan cinco autores, 200 comparaciones binarias por persona y 1.000 en total, sobre expresión emocional y fluidez de configuraciones seleccionadas. El orden general se parece al de GPT-4o, pero las diferencias son menores y Krippendorff alpha es aproximadamente 0,59: acuerdo moderado, no fuerte. Tampoco es una muestra independiente o representativa.
El paper reconoce dependencia de LLM-as-judge, domain shift, cobertura psicológica parcial, inglés, checkpoints concretos y ausencia de horizontes largos. Los experimentos principales usan GPT-4o como juez; por coste, el apéndice cambia a gpt-oss-20b y baja el umbral de calidad textual de 4,0 a 2,5 porque ambos jueces difieren en fluidez. Por tanto, la identidad del juez forma parte de la definición de medida. El trabajo estudia expresión simulada bajo prompts y modificaciones de activación: no demuestra emoción sentida, personalidad interna, conciencia, identidad estable ni equivalencia con una puntuación humana. Sus recomendaciones de revelar el steering, obtener consentimiento, limitar intensidad y registrar parámetros son sensatas, pero no se validan experimentalmente.
El repositorio oficial es sustancial pero no reproduce el artículo de extremo a extremo. En el commit 18f5981 hay 231 ficheros, 43 módulos Python y datos para steering y TrustLLM; todos los Python parsean y las 30 variantes de loader se cargan. Sin embargo, el último commit es de octubre de 2025, nueve meses anterior a la camera-ready. No hay generaciones, resultados, vectores, adaptadores, ratings humanos, matriz del barrido ni fuentes de tablas/figuras. El comando README para fairness usa sad donde los datos exigen sadness y falla; el evaluador online borra OPENAI_API_KEY y llama a gpt-4o-mini aunque el paper declara GPT-4o; LingProf guarda la media también en scores_std; las opciones booleanas de argparse no interpretan correctamente False; y fastchat==0.1.0 no es el paquete LMSYS fschat que importa el código. No existen tests, CI, lockfile, contenedor o licencia de código/datos. La reproducción seleccionada requiere, según los autores, unas 48 horas en A40 y al menos 40 GB de VRAM para modelos grandes, sin contar el barrido. PsySET aporta evidencia amplia y valiosa de que el steering psicológico es controlable pero puede degradar calidad y confianza de maneras no intuitivas; no aporta una receta universal, una medida de personalidad humana ni un artefacto publicado que permita verificar todas sus cifras.