El trabajo propone un protocolo psicométrico para decidir si las respuestas de un modelo a inventarios Big Five son consistentes, convergen entre instrumentos, se distinguen de otros rasgos y se relacionan con criterios externos; además prueba si esos patrones pueden inducirse mediante prompts y aparecer en texto abierto. Evalúa 18 variantes de PaLM, Llama 2, Mistral, Mixtral y GPT. Para la medición administra por separado los 300 ítems del IPIP-NEO, los 44 del BFI y 11 subescalas externas. Cada ítem se combina con 50 descripciones biográficas de PersonaChat, cinco instrucciones y cinco formatos de respuesta, lo que produce 1.250 perfiles emparejados y 523.750 respuestas por modelo. La fiabilidad se contrasta con alfa de Cronbach, lambda-6 de Guttman y omega de McDonald; la validez convergente y discriminante se examina con una matriz multirrasgo-multimétodo y la validez de criterio con afecto, agresión, valores y creatividad. Los modelos base ofrecen respuestas generalmente no fiables y sin validez convergente, mientras que el ajuste de instrucciones es el factor más consistente de mejora; dentro de modelos instruidos, el tamaño suele mejorar los resultados. Flan-PaLM 540B y GPT-4o alcanzan una correlación convergente media de 0,90 y diferencias discriminantes de 0,51 y 0,48. Para inducir rasgos, los autores construyen 104 pares de marcadores léxicos y nueve niveles de intensidad. La inducción de un solo rasgo funciona con gran monotonicidad en once de doce modelos, pero el rango efectivo es mucho menor en sistemas pequeños. Inducir los cinco rasgos simultáneamente es más difícil: Flan-PaLM 540B y GPT-4o logran las mayores separaciones medias, alrededor de 2,5 puntos, y apertura es el dominio más resistente. En una tarea posterior, cuatro modelos generan actualizaciones de redes sociales condicionadas por los mismos perfiles; las puntuaciones del cuestionario correlacionan en promedio 0,67 con estimaciones lingüísticas de personalidad, y los niveles pedidos correlacionan entre 0,68 y 0,82 con el texto observado. Es evidencia de regularidades de salida bajo este protocolo, no de personalidad humana interna. La validez externa queda limitada por pruebas en inglés, prompts estructurados, elección de instrumentos, puntuación restringida de ítems y una única familia de tarea generativa.
Pregunta de investigación
¿Pueden medirse rasgos Big Five sintetizados por LLM de forma fiable, válida y con significado práctico; pueden inducirse a niveles deseados; y predicen las medidas de cuestionario la expresión de esos rasgos en texto generado?