Este preprint estudia si diez agentes basados en GPT-3.5-turbo, definidos mediante etiquetas opuestas de los Big Five, producen patrones diferentes al valorar desinformación en una simulación de aula con AgentVerse. Cada par representa los extremos de un dominio: curioso/cauteloso, organizado/descuidado, extrovertido/reservado, amistoso/crítico y sensible/confiado. Un agente facilitador actúa como profesor. Cada estudiante presenta una afirmación falsa distinta y los otros nueve generan una opinión pública marcada como [Speak] y un texto supuestamente privado marcado como [Think]; los silencios se excluyen. Antes y después de la simulación, los agentes puntúan en una escala 1–5 enunciados adaptados de un estudio anterior para comprobar que sus instrucciones de personalidad siguen visibles. La tabla de estabilidad parece resumir 50 ejecuciones, aunque el artículo no describe de forma reproducible el número de iteraciones, los prompts completos, los parámetros de generación ni la instantánea exacta de GPT-3.5-turbo. Los conteos descriptivos muestran el contraste mayor entre el agente curioso, con 100 respuestas públicas afirmativas y 8 negativas, 92,6 % de aceptación, y el cauteloso, con 4 afirmativas y 223 negativas, 97,8 % de rechazo. El agente crítico también rechaza con frecuencia, 23 sí y 207 no; los resultados de las demás etiquetas son más equilibrados. La discrepancia [Speak]–[Think] es mayor para amistoso (158 casos), extrovertido (132), descuidado (130) y sensible (106), y menor para cauteloso (6), confiado (15), crítico (31) y curioso (35). El manuscrito interpreta estos patrones como influencia de apertura, responsabilidad y extraversión sobre la aceptación de información y como sensibilidad social en algunos perfiles. Esa lectura debe tomarse como exploratoria. No se reportan coeficientes de correlación, pruebas de significación, intervalos de confianza ni un modelo estadístico, pese a que el abstract habla de «correlaciones significativas». Tampoco existe una condición sin etiquetas de personalidad, aleatorización de prompts, replicación con otros modelos o evaluación humana. [Think] no es acceso a una creencia privada del sistema: es otra salida textual solicitada en el mismo prompt, por lo que su diferencia con [Speak] no demuestra cognición disonante. Los diez temas, el orden de interacción, el rol de quien presenta cada falsedad y la etiqueta del agente pueden confundirse con el efecto atribuido al rasgo. Los extremos se expresan mediante adjetivos binarios, no mediante un instrumento Big Five validado ni puntuaciones continuas. En consecuencia, el estudio documenta frecuencias distintas de texto generado por una única configuración de GPT-3.5 bajo diez personas instruidas; no establece rasgos psicológicos, mecanismos de decisión ni comportamiento humano simulado con validez externa. Además, varias referencias genéricas del manuscrito carecen de identificadores y no se localizaron en los índices editoriales primarios consultados, lo que reduce la trazabilidad de su marco teórico.
Pregunta de investigación
¿Qué etiquetas opuestas de los Big Five modifican con mayor claridad las respuestas públicas y los textos [Think] de agentes GPT-3.5 ante desinformación en una simulación social de aula?