Este preprint presenta TRAIT, un benchmark en inglés de 8.000 preguntas de elección múltiple para estudiar patrones de respuesta asociados a cinco rasgos Big Five y tres rasgos de la Tríada Oscura. Parte de 44 ítems BFI y 27 SD-3: GPT-4 los expande a 1.600 descripciones, para cada descripción selecciona cinco de veinte situaciones muestreadas de ATOMIC10X y construye una situación, pregunta y cuatro recomendaciones, dos etiquetadas high y dos low. El resultado es unas 112 veces mayor que las 71 semillas; la cifra de 225× que aparece en el diagrama no coincide con el cómputo por ítems. Dos estudiantes de posgrado con formación en psicología etiquetan solo 200 ítems y alcanzan 97,5 % al distinguir high/low. Esta comprobación respalda que una muestra de opciones expresa la polaridad pretendida, pero no valida los 8.000 ítems, su especificidad de rasgo, estructura factorial, invariancia o relación con conducta. El paper denomina «validez de contenido» a la diversidad y uniformidad de facetas asignadas por GPT-4; «validez interna» a la diferencia de puntuación al instruir niveles altos o bajos; y «fiabilidad» a la sensibilidad a tres prompts, al orden de opciones y a paráfrasis. Son operaciones útiles para auditar cobertura, seguimiento de instrucciones y robustez, pero no equivalen por sí solas a esos constructos psicométricos. Promediado sobre ocho modelos, TRAIT obtiene diversidad 71,9 y diferencia 77,5 en Big Five, y 51,0/83,3 en Tríada Oscura; su sensibilidad media es 29,8 % y 24,4 %, respectivamente. Aunque mejora los baselines, que entre una cuarta y una tercera parte de las respuestas cambie muestra consistencia relativa, no estabilidad fuerte. La tasa de rechazo es casi cero en elección múltiple y 3,1–3,3 % en generación, frente a valores mucho mayores en tests de autoinforme; el detector se limita a frases iniciales predefinidas y puede confundir formato con rechazo. La puntuación TRAIT promedia probabilidades de tokens A–D bajo dos disposiciones de opciones y calcula el porcentaje de elecciones high. No es una escala factorial y dos permutaciones no agotan los 24 órdenes posibles. En nueve modelos, GPT-4 y Claude-Sonnet puntúan 86–87 en amabilidad y 0–11 en Tríada Oscura. Al agrupar modelos alineados y base, los primeros promedian más amabilidad (78,3 frente a 66,7) y responsabilidad (91,0 frente a 81,7), menos apertura (56,3 frente a 67,8), extraversión (32,8 frente a 46,9) y Tríada Oscura (9,3 frente a 27,0). Esta comparación mezcla familias y tamaños, de modo que no identifica causalmente el efecto del alineamiento. La secuencia controlada Llama2-7B→Tulu2-SFT→Tulu2-DPO sí sugiere que SFT desplaza con fuerza las elecciones, por ejemplo +22,9 en amabilidad, −22,9 en extraversión y −49,8 en psicopatía, mientras DPO cambia poco; sin embargo, el pie de la Tabla 7 describe la resta en sentido contrario a la interpretación y el clasificador usado para etiquetar los datos de entrenamiento, T-EVALUATOR, se entrena con TRAIT sintético. La correlación 0,7893 entre balance del corpus y cambio de rasgo excluye apertura post hoc, usa solo siete rasgos y no demuestra causalidad. Tres prompts de persona producen una puntuación direccional media de 85,2, pero los resultados finos varían mucho por plantilla y modelo: en GPT-4, por ejemplo, psicopatía alta va de 37,3 a 99,7. Las correlaciones inducidas entre rasgos oscuros llegan a 0,90–0,97, muy por encima de las humanas; reflejan al menos en parte el contenido compartido del prompt y del generador, no una estructura psicológica natural. Las cinco situaciones derivadas de una misma descripción también cambian la elección, algo compatible tanto con sensibilidad contextual como con ruido o diferencias entre escenarios. Finalmente, correlaciones entre TRAIT y benchmarks generales se calculan con ocho modelos y sin ajustar familia, tamaño o alineamiento; no establecen poder predictivo de la personalidad. El aporte defendible es un banco de escenarios amplio y una auditoría multifactor de respuestas, no una prueba de personalidad interna, psicometría humana equivalente ni validez conductual.
Pregunta de investigación
¿Puede un benchmark de escenarios construido específicamente para LLM medir patrones de respuesta diferenciados y relativamente consistentes, y qué muestran esos patrones sobre prompting, alineamiento y composición de datos de entrenamiento?