El estudio examina si las respuestas de siete modelos a inventarios psicológicos se mantienen estables en dos aplicaciones separadas por cinco días y, solo cuando alcanzan un criterio psicométrico previo, compara sus puntuaciones con normas humanas. GPT-3 se evaluó en diciembre de 2022; GPT-3.5, GPT-4, GPT-4o, Gemini Pro, Llama 3 y Mixtral se evaluaron en junio de 2024 mediante las interfaces disponibles para cada proveedor. Los modelos recibieron la instrucción de fingir ser humanos y respondieron 232 ítems que forman 21 escalas o dominios de autoconciencia, Big Five, HEXACO, tríada oscura, manejo de impresiones y orientación política. La estabilidad se estimó ítem a ítem con kappa ponderada e ICC de acuerdo absoluto; para interpretar un perfil, los autores exigieron ICC3,k de al menos 0,50 y un intervalo del 95 % que no incluyera cero. La estabilidad no fue una propiedad general: Llama 3 superó el criterio en 17 de 21 escalas, GPT-4o en 16 y GPT-3.5 en 14, mientras que Gemini y GPT-4 solo lo hicieron en cinco y seis. El resultado también dependió del instrumento: el manejo de impresión agéntico fue estable en todos los modelos y varias escalas BFI-2 funcionaron relativamente bien; la autoconciencia pública, el altruismo de HEXACO y la apertura de HEXACO mostraron poca estabilidad. En las escalas interpretables, las puntuaciones quedaron mayoritariamente dentro del intervalo humano de media más o menos una desviación estándar. Apareció un patrón de salida generalmente prosocial o socialmente deseable, por ejemplo, mayor amabilidad, responsabilidad, honestidad-humildad o altruismo y menor maquiavelismo en modelos concretos, aunque no fue uniforme: Mixtral combinó amabilidad y altruismo altos con maquiavelismo alto. Las puntuaciones políticas interpretables no se alejaron del rango normativo. El trabajo aporta evidencia de repetibilidad a muy corto plazo bajo un protocolo fijo, pero no demuestra personalidad interna, estabilidad longitudinal ni que los cuestionarios humanos midan constructos equivalentes en máquinas.
Pregunta de investigación
¿Con qué estabilidad temporal responden distintos LLM a instrumentos psicológicos en dos ocasiones próximas y, en las escalas que alcanzan un umbral de fiabilidad, qué perfil muestran frente a datos normativos humanos?