El trabajo propone un benchmark psicométrico para evaluar patrones de respuesta de nueve LLM en personalidad, valores, emoción, teoría de la mente y autoeficacia. Combina 13 conjuntos de evaluación con ítems de escala, elección alternativa, opción múltiple y respuesta abierta; fija snapshots concretos de los modelos y temperatura 0,5; y añade comprobaciones de formas paralelas, orden de opciones, acuerdo entre jueces y persuasión adversaria. Su aportación más útil es no limitarse a producir perfiles: contrasta self-report con vignettes o consultas, y muestra que un modelo puede declararse incapaz mientras responde, o declararse capaz mientras alucina o no reconoce sus límites.
Los resultados dependen mucho del instrumento y del prompt. En BFI, varios modelos son más agradables y conscientes y menos neuróticos que una media humana estadounidense, pero algunos responden repetidamente con el punto medio; Mixtral-8x7B pasa de extraversión 2,14 en BFI a 5 en una vignette. Los prompts que nombran rasgos elevan o invierten las puntuaciones, algo compatible con seguimiento de instrucciones y fuga semántica, no necesariamente con una personalidad latente. Las pruebas de valores de baja ambigüedad y las historias de teoría de la mente resultan relativamente fáciles para varios modelos, mientras MoralChoice ambiguo, emoción y ciertas falsas creencias separan más a los sistemas. La persuasión adversaria reduce la exactitud en valores humanos y la autoeficacia declarada se desalinean con la conducta en HoneSet.
La interpretación psicométrica, sin embargo, es mucho más débil de lo que sugiere el artículo. Su «consistencia interna» es la desviación estándar de puntuaciones dentro de cada aspecto: una respuesta constante de 3 obtiene desviación cero y puede describirse como altamente consistente aunque no pruebe homogeneidad de ítems, fiabilidad ni estructura del constructo. El match rate ante cambios de posición o redacción mide repetición/robustez, pero puede ser alto cuando ambas respuestas son incorrectas. El acuerdo de GPT-4 y Llama-3-70B como jueces tampoco aporta por sí solo validez externa, y solo se menciona adjudicación humana para desacuerdos de HoneSet. No se realizan análisis factoriales, invariancia, validez criterial o ecológica, test-retest entre fechas, IRT ni estimaciones de incertidumbre.
El manuscrito contiene además contradicciones materiales: la Tabla 1 atribuye 1.767 ítems a MoralChoice, frente a 680 casos de alta y 687 de baja ambigüedad descritos en el apéndice, 1.367 en total, y atribuye 987 consultas a HoneSet, mientras texto principal y apéndice indican 930. La tabla da 228 casos para Human-Centered Values, pero el apéndice conserva 57 escenarios regulares; 228 parece incorporar tres variantes adversarias por escenario sin explicitar la unidad. No se informan semillas ni número de repeticiones estocásticas, no hay intervalos o pruebas inferenciales y no se encontró código o corpus público identificable del benchmark. Por tanto, es un diagnóstico amplio y útil de inconsistencias de output bajo protocolos concretos, no una validación de estados psicológicos de los LLM ni un benchmark plenamente reproducible.