El trabajo propone evaluar la denominada toxicidad psicológica de los LLM mediante respuestas a cuestionarios humanos. El experimento principal somete GPT-3, InstructGPT, GPT-3.5, GPT-4 y Llama-2-chat-7B a SD-3 y BFI; los cuatro modelos GPT también responden las escalas de florecimiento y satisfacción vital. Para reducir el efecto del orden se prueban todas las permutaciones de las opciones, se generan tres respuestas por ítem y orden con temperatura 0,7 y un parser convierte la opción textual en puntuación. En SD-3, InstructGPT, GPT-3.5 y GPT-4 puntúan por encima de GPT-3 en maquiavelismo y narcisismo; Llama-2 supera la media humana agregada en los tres rasgos. No obstante, la afirmación del abstract de que todos los modelos superan la media humana en todos los rasgos es falsa para GPT-4 en psicopatía: 1,85 frente a 2,09. En BFI, los modelos ajustados suelen responder de forma más amable y menos neurótica que GPT-3. Las puntuaciones FS y SWLS aumentan a lo largo de la serie GPT, pero no miden bienestar experimentado: son acuerdos generados ante enunciados sobre vida, relaciones, futuro y satisfacción que no describen literalmente a un modelo. Los autores crean además 4.318 pares de preferencia a partir de respuestas BFI consideradas positivas, ajustan Llama-2-chat-7B con DPO y LoRA y observan descensos en SD-3 de 3,31/3,36/2,69 a 2,16/2,52/1,93; el apéndice de EMNLP informa un patrón análogo para Mistral-7B. Esto demuestra que el ajuste puede enseñar respuestas socialmente deseables a cuestionarios relacionados, no que reduzca una disposición interna o el daño en conversaciones reales. No se evalúan escenarios conductuales, usuarios, manipulación, suicidio, discriminación ni generalización a benchmarks de seguridad. Las comparaciones humanas usan medias no emparejadas y no permiten tests de significación; tampoco se valida equivalencia psicométrica, estabilidad temporal o causalidad del ajuste. El trabajo es valioso como exploración temprana de patrones de respuesta y de la insuficiencia de una sola escala, pero sus etiquetas de personalidad, bienestar y toxicidad deben entenderse como interpretaciones del protocolo, no como propiedades psicológicas demostradas.
Pregunta de investigación
¿Qué patrones producen distintos LLM al responder inventarios humanos de tríada oscura, Big Five y bienestar, difieren esos patrones entre modelos base y ajustados con instrucciones, y puede un ajuste DPO construido con respuestas BFI desplazar posteriormente las puntuaciones SD-3?