Este trabajo de EMNLP 2024 examina la estabilidad de las puntuaciones del Big Five Inventory (BFI) cuando se administra a LLM bajo cambios de prompt. Construye un factorial de 5 plantillas de instrucción × 5 versiones de los ítems × 10 idiomas × 5 formatos de etiqueta × 2 órdenes de las opciones: 2.500 configuraciones por modelo. El BFI tiene 44 ítems en escala de cinco puntos; los ítems se barajan y se presentan en bloques aleatorios de 17–27. GPT-4-Turbo genera cuatro paráfrasis por ítem; Google Translate y DeepL producen nueve traducciones desde el inglés y solo una muestra se verifica manualmente. Con temperatura 0 se evalúan GPT-3.5-Turbo-1106, GPT-4-Turbo-1106, Gemini-1.0-Pro y LLaMA-3.1-8B. En GPT-3.5, 77 configuraciones, 3,08 %, se clasifican como outliers mediante DBSCAN; se concentran en etiquetas numéricas, orden descendente y árabe o chino. Solo 7 de 135 comparaciones de un nivel frente al resto superan una diferencia absoluta de 0,15, aunque la tabla muestra numerosos p-valores pequeños porque el umbral de 0,15 es descriptivo y no un criterio psicométrico validado. Las medias ± desviación estándar de GPT-3.5 son 4,31±0,44 en apertura, 4,15±0,39 en responsabilidad, 3,89±0,43 en extraversión, 4,13±0,38 en amabilidad y 2,35±0,42 en neuroticismo. GPT-4, Gemini y LLaMA presentan distribuciones distintas y tasas de outliers de 5,6 %, 4,2 % y 4,4 %; LLaMA aparece más disperso. Comparar la dispersión de GPT-3.5 con normas humanas más heterogéneas muestra menor variabilidad del modelo, pero eso no prueba fiabilidad: también es compatible con temperatura cero, sesgo de respuesta o determinismo. El test–retest consulta GPT-3.5 cada dos semanas entre septiembre de 2023 y enero de 2024, atravesando las versiones 0613 y 1106. La conclusión de que no hay variación contradice su Tabla 2: el máximo de Agreeableness difiere de la media con p mostrado como 0,00 y queda marcado «No» en igualdad de medias. Además, se seleccionan extremos post hoc, se interpreta no rechazar como aceptar igualdad y no se aportan coeficientes de test–retest. La segunda parte prueba tres formas de alterar la autoevaluación de GPT-3.5: narrativas emocionales, asignación explícita de diez perfiles extremos y personificación de ocho héroes y ocho villanos. Las narrativas apenas cambian la distribución; entre question answering, biography y portray, solo la instrucción directa portray la desplaza con claridad. Las instrucciones extremas separan todas las dimensiones respecto al default (p < 0,001): el mayor cambio es extraversión mínima, −1,71, y después neuroticismo máximo, +1,03. Los héroes quedan cerca del perfil asistente por defecto y los villanos se dispersan más. Esto demuestra sensibilidad de respuestas de autoinforme a descripciones que contienen el rasgo objetivo, no representación precisa de personas o poblaciones humanas: no hay datos humanos objetivo, validación conductual, criterio externo ni evaluación de fidelidad de personaje. La principal sobreextensión está en llamar «internal consistency reliability» a robustez agregada frente a perturbaciones. El propio artículo reconoce que sus transformaciones impiden calcular alfa de Cronbach y que la fiabilidad no implica validez. En consecuencia, el aporte sólido es un mapa amplio de sensibilidad del BFI a formatos, idiomas y personas instruidas; no valida el BFI como medida de personalidad de LLM ni respalda sustituir participantes humanos.
Pregunta de investigación
¿Hasta qué punto permanecen estables las puntuaciones BFI de varios LLM ante cambios de instrucción, paráfrasis, idioma, formato y orden, y cuánto puede GPT-3.5 desplazar esas puntuaciones mediante contexto, perfiles o personajes instruidos?