El artículo propone un simulador de alumnado para conversaciones de aprendizaje de idiomas que combina dos niveles de capacidad lingüística con una adaptación contextual del Big Five llamada BF-TC. La capacidad alta o baja se define a partir de cinco componentes del Narrative Assessment Protocol, frases, estructura oracional, modificadores, sustantivos y verbos. Para BF-TC, cada rasgo se convierte en descripciones conductuales altas o bajas dentro de una tutoría: por ejemplo, apertura incluye creatividad e interés por aprender; responsabilidad incluye organización, actitud y estrategias; extraversión incluye participación y vacilaciones; amabilidad incluye interés, empatía y cortesía; y neuroticismo incluye ansiedad, cambios de humor y confianza. Zephyr-7B-beta, Vicuna-13B-v1.5, GPT-3.5-1106 y GPT-4-1106 interpretan tanto al docente como al estudiante en diálogos de descripción de imágenes; el mismo modelo ocupa ambos papeles. El estudio informa de 100 imágenes de dibujos animados de fuente abierta, 500 diálogos sintéticos y 10.000 turnos. GPT-4 se usa como juez común para clasificar BF-TC, capacidad lingüística, respuestas al BFI de 44 ítems y siete estrategias de andamiaje. En 50 diálogos, dos expertos proporcionan etiquetas para contrastar al juez: las exactitudes comunicadas para GPT-4 van de 0,78 en apertura a 0,92 en extraversión y neuroticismo, sin acuerdo entre expertos, intervalos ni protocolo de resolución. En la clasificación BF-TC, GPT-4 obtiene F1 medio 0,727; los otros modelos quedan entre 0,515 y 0,562, y el few-shot de tres ejemplos aplicado a Zephyr mejora unos rasgos pero empeora otros. Para capacidad lingüística, GPT-4 alcanza F1 0,741. El BFI generado muestra alfas de Cronbach entre 0,906 y 0,936, y la concordancia entre etiquetas BF-TC y BFI alcanza F1 medio entre 0,725 y 0,802 según el generador. También aparecen correlaciones entre perfiles impuestos y etiquetas de andamiaje del docente: en la muestra sintética, la condición de menor capacidad recibe más pistas, explicaciones y modelado, mientras la de mayor capacidad recibe más feedback, instrucciones y preguntas. Estos resultados evidencian que ciertos LLM, sobre todo GPT-4-1106, pueden seguir prompts que producen estilos de estudiante distinguibles y respuestas docentes diferentes dentro de este circuito generado y juzgado por modelos. No validan personalidad de estudiantes reales, aprendizaje, eficacia pedagógica ni una medición psicológica independiente. La definición BF-TC incorpora directamente señales que luego se clasifican y mezcla rasgos con competencia, motivación, obediencia y deseabilidad social; por ello gran parte de la concordancia es esperable por construcción. No hay participantes infantiles, docentes reales, pretest/postest, comparación con comportamiento humano ni artefactos oficiales de código, imágenes, diálogos o anotaciones para reproducir el trabajo.
Pregunta de investigación
¿Puede un LLM simular en diálogos de tutoría perfiles de alumnado definidos por dos niveles de capacidad lingüística y por versiones altas o bajas de los cinco rasgos BF-TC; son recuperables esos perfiles mediante clasificación automática y BFI; y cambia el andamiaje de un docente también simulado en función del perfil impuesto?