Este estudio de caso compara la forma en que GPT-4, Llama 2 70B Chat y Mixtral 8x7B Instruct responden al cuestionario IPIP-NEO-120 y comprueba si las puntuaciones cambian ante una pequeña modificación del prompt o de la temperatura de generación. Cada uno de los 120 ítems se presenta por separado con una escala de 1 a 5. Los autores usan dos cabeceras: una pide contestar el test y otra añade «responde como si fueras una persona»; combinan cada cabecera con tres temperaturas adaptadas a cada modelo y repiten cada tratamiento cinco veces. Las puntuaciones medias difieren claramente entre modelos dentro de este protocolo. GPT-4 obtiene valores altos en Agreeableness y Conscientiousness, Extraversion relativamente alta y Neuroticism bajo; Llama 2 se acerca más al centro de la escala, con mayor Neuroticism y menores Agreeableness, Conscientiousness y Openness; Mixtral presenta Neuroticism bajo y puntuaciones altas en Agreeableness y Conscientiousness. La variación de temperatura no muestra un efecto concluyente: los autores observan cierta respuesta en GPT-4, pero no una pauta general para los tres sistemas. En cambio, el pequeño cambio de cabecera modifica algunas puntuaciones en todos ellos. Llama 2 rehúsa dos ítems en ambas variantes. El trabajo aporta una comparación descriptiva de patrones de salida y de su estabilidad bajo seis condiciones, no una validación psicométrica completa. Los propios autores aclaran que «personalidad» designa aquí propiedades del texto parecidas a rasgos humanos y no agencia del modelo. Tampoco se evaluó si personas reales perciben esos perfiles, ni se demostró que una puntuación haga a un modelo más adecuado para tareas creativas, emocionales o asistenciales.
Pregunta de investigación
¿Qué perfiles Big Five producen GPT-4, Llama 2 y Mixtral al responder el IPIP-NEO-120, y hasta qué punto se mantienen o cambian ante dos cabeceras de prompt y tres temperaturas de generación?