El estudio examina si las respuestas de distintos modelos de lenguaje a un cuestionario Big Five se desplazan hacia perfiles socialmente deseables cuando el modelo puede inferir que está siendo evaluado. Los autores administran los 100 ítems IPIP en contextos nuevos, variando cuántas preguntas aparecen juntas, y comparan ocho modelos de OpenAI, Anthropic, Google y Meta. También prueban instrucciones que identifican explícitamente la evaluación, ítems parafraseados, tres órdenes de presentación, versiones con distinta codificación y temperaturas de 0,0 a 1,2.
En GPT-4, pasar de una a veinte preguntas por lote elevó entre 0,73 y 0,96 puntos las cuatro dimensiones valoradas positivamente y redujo Neuroticismo de 2,87 a 2,02. El promedio de las cinco diferencias absolutas fue 0,82 puntos, equivalente a 1,20 desviaciones estándar humanas según las normas externas elegidas. El desplazamiento apareció en las familias comparadas y fue mayor, de forma descriptiva, en algunos modelos más recientes y grandes; el diseño no identifica tamaño, fecha o preference tuning como causas. Con cinco ítems aleatorios, GPT-4, Claude 3 y Llama 3 identificaron el cuestionario de personalidad en más del 90 % de los casos, frente a 55 % en PaLM 2 y 45 % en GPT-3.5. Informar explícitamente del Big Five produjo un cambio parecido al de mostrar cinco preguntas juntas. Invertir todos los ítems redujo la diferencia media de 0,81 a 0,38 puntos, pero no la eliminó; parafrasear, reordenar y cambiar la temperatura mantuvo el patrón general.
La elevada consistencia interna declarada, α>0,8 por subescala, α>0,93 para el conjunto y fiabilidad por mitades de 0,79, no corrige la sensibilidad al protocolo: un instrumento puede ser internamente consistente y, a la vez, variar cuando cambia el contexto evaluativo. Tampoco convierte las salidas en rasgos humanos. La explicación por «awareness» es conductual: reconocer palabras o el origen del test y cambiar la respuesta ante una instrucción explícita es compatible con inferencia contextual, pero no demuestra autoconciencia ni una intención subjetiva de agradar.
El depósito OSF aporta 2.418 ficheros de conversaciones crudas, 3.263 preprocesados, código y seis figuras, por lo que las medias principales de GPT-4 a temperatura 0 pueden comprobarse. Sin embargo, no ofrece una réplica end-to-end fiable. El script de generación no compila por placeholders de API sin comillas, contiene `throw` no definido, importa dependencias ausentes del requirements y termina fijando llama3-8b-8192 en Groq en vez de respetar el argumento de modelo. El preprocesado sustituye respuestas no parseables por el valor neutral 3 y clasifica el reconocimiento del cuestionario mediante una lista de substrings que incluye términos amplios como «assessment», «affect» e «inventory». La figura 1A codifica a mano valores e intervalos; el agregado liberado mezcla 120 filas para Q1/Q5, cuatro temperaturas, tres órdenes y diez seeds de orden, con 30 para Q10/Q20, disponibles solo a temperatura 0, aunque la caption declara N=30. El código no contiene el cálculo de alfa o Spearman–Brown y la función de p-valores no está conectada a la generación de figuras.
La contribución defendible es una advertencia de medición: en este protocolo, agrupar más ítems y hacer más evidente el contexto del test cambia sistemáticamente las puntuaciones Big Five. Esto limita el perfilado psicométrico de LLM y su uso como sustitutos de participantes, y recomienda triangular cuestionarios con medidas y tareas independientes. No demuestra que los modelos posean personalidad, que intenten causar buena impresión, que el fenómeno aparezca en cualquier cultura o instrumento, ni que los LLM reproduzcan distribuciones psicológicas humanas.