Personality-aware Student Simulation for Conversational Intelligent Tutoring Systems

Aplicaciones, sesgos y seguridad2024ACL AnthologyRevisión editorial aprobada

Autores: Zhengyuan Liu, Stella Xin Yin, Geyu Lin, Nancy F. Chen

Palabras clave: intelligent tutoring systems, student simulation, personality traits, educational technology, language learning, conversational AI, personalized learning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
19
Hallazgos
38
Limitaciones
18
Evidencias

Resumen editorial

Español

El artículo propone un simulador de alumnado para conversaciones de aprendizaje de idiomas que combina dos niveles de capacidad lingüística con una adaptación contextual del Big Five llamada BF-TC. La capacidad alta o baja se define a partir de cinco componentes del Narrative Assessment Protocol, frases, estructura oracional, modificadores, sustantivos y verbos. Para BF-TC, cada rasgo se convierte en descripciones conductuales altas o bajas dentro de una tutoría: por ejemplo, apertura incluye creatividad e interés por aprender; responsabilidad incluye organización, actitud y estrategias; extraversión incluye participación y vacilaciones; amabilidad incluye interés, empatía y cortesía; y neuroticismo incluye ansiedad, cambios de humor y confianza. Zephyr-7B-beta, Vicuna-13B-v1.5, GPT-3.5-1106 y GPT-4-1106 interpretan tanto al docente como al estudiante en diálogos de descripción de imágenes; el mismo modelo ocupa ambos papeles. El estudio informa de 100 imágenes de dibujos animados de fuente abierta, 500 diálogos sintéticos y 10.000 turnos. GPT-4 se usa como juez común para clasificar BF-TC, capacidad lingüística, respuestas al BFI de 44 ítems y siete estrategias de andamiaje. En 50 diálogos, dos expertos proporcionan etiquetas para contrastar al juez: las exactitudes comunicadas para GPT-4 van de 0,78 en apertura a 0,92 en extraversión y neuroticismo, sin acuerdo entre expertos, intervalos ni protocolo de resolución. En la clasificación BF-TC, GPT-4 obtiene F1 medio 0,727; los otros modelos quedan entre 0,515 y 0,562, y el few-shot de tres ejemplos aplicado a Zephyr mejora unos rasgos pero empeora otros. Para capacidad lingüística, GPT-4 alcanza F1 0,741. El BFI generado muestra alfas de Cronbach entre 0,906 y 0,936, y la concordancia entre etiquetas BF-TC y BFI alcanza F1 medio entre 0,725 y 0,802 según el generador. También aparecen correlaciones entre perfiles impuestos y etiquetas de andamiaje del docente: en la muestra sintética, la condición de menor capacidad recibe más pistas, explicaciones y modelado, mientras la de mayor capacidad recibe más feedback, instrucciones y preguntas. Estos resultados evidencian que ciertos LLM, sobre todo GPT-4-1106, pueden seguir prompts que producen estilos de estudiante distinguibles y respuestas docentes diferentes dentro de este circuito generado y juzgado por modelos. No validan personalidad de estudiantes reales, aprendizaje, eficacia pedagógica ni una medición psicológica independiente. La definición BF-TC incorpora directamente señales que luego se clasifican y mezcla rasgos con competencia, motivación, obediencia y deseabilidad social; por ello gran parte de la concordancia es esperable por construcción. No hay participantes infantiles, docentes reales, pretest/postest, comparación con comportamiento humano ni artefactos oficiales de código, imágenes, diálogos o anotaciones para reproducir el trabajo.

English

The paper proposes a student simulator for language-learning conversations that combines two language-ability levels with a contextual Big Five adaptation called BF-TC. High versus low ability is defined through five Narrative Assessment Protocol components: phrases, sentence structure, modifiers, nouns, and verbs. BF-TC turns each trait into high/low tutoring behaviors: for example, openness includes creativity and interest in learning; conscientiousness includes organization, attitude, and strategies; extraversion includes participation and hesitation; agreeableness includes interest, empathy, and politeness; and neuroticism includes anxiety, mood shifts, and confidence. Zephyr-7B-beta, Vicuna-13B-v1.5, GPT-3.5-1106, and GPT-4-1106 play both teacher and student in image-description dialogues, with the same model filling both roles. The study reports 100 open-source cartoon images, 500 synthetic dialogues, and 10,000 utterances. GPT-4 is the common judge for BF-TC classification, language-ability labeling, a generated 44-item BFI, and seven teacher-scaffolding labels. On 50 dialogues, two experts supply labels for a judge check: reported GPT-4 accuracies range from 0.78 for openness to 0.92 for extraversion and neuroticism, but the paper gives no inter-expert agreement, intervals, or adjudication protocol. For BF-TC classification, GPT-4 reaches 0.727 average F1; other generators range from 0.515 to 0.562, while three-shot prompting for Zephyr helps some traits and harms others. GPT-4 reaches 0.741 F1 for language ability. Generated BFI responses yield Cronbach’s alpha values from 0.906 to 0.936, and agreement between BF-TC and BFI labels averages 0.725 to 0.802 F1 across generators. Correlations also appear between imposed student profiles and model-labeled teacher scaffolding: in this synthetic sample, the low-ability condition receives more hints, explanations, and modeling, whereas the high-ability condition receives more feedback, instructions, and questions. These results show that some LLMs, especially GPT-4-1106, can follow prompts that create distinguishable student styles and different teacher responses inside a model-generated, model-judged loop. They do not validate real students’ personalities, learning, pedagogical effectiveness, or an independent psychological measure. BF-TC directly embeds the cues later used for classification and blends traits with competence, motivation, compliance, and social desirability, so much of the agreement is expected by construction. There are no child participants, real teachers, pre/post learning outcomes, behavioral comparison with humans, or official releases of the code, images, dialogues, and annotations needed for reproduction.

Pregunta de investigación

¿Puede un LLM simular en diálogos de tutoría perfiles de alumnado definidos por dos niveles de capacidad lingüística y por versiones altas o bajas de los cinco rasgos BF-TC; son recuperables esos perfiles mediante clasificación automática y BFI; y cambia el andamiaje de un docente también simulado en función del perfil impuesto?

Método

Los autores definen capacidad lingüística alta y baja mediante cinco componentes inspirados en NAP y reformulan el Big Five como BF-TC, una lista de conductas observables en conversaciones educativas. Prompts separados especifican los papeles de docente y estudiante, la tarea de describir una imagen, el enfoque docente de construcción del conocimiento, el nivel de capacidad y las descripciones BF-TC. Un entorno multiagente alterna ambos roles usando el mismo LLM. Cuatro modelos generan diálogos a partir de descripciones de imágenes; GPT-4 etiqueta cada conversación por rasgos BF-TC y capacidad, hace que el estudiante simulado conteste el BFI de 44 ítems y clasifica cada turno docente en siete tipos de andamiaje. Dos expertos etiquetan 50 diálogos para una comprobación parcial del juez. El análisis comunica precisión, recall y F1, estadísticos y alfa de Cronbach del BFI, correlaciones de Pearson entre sus escalas, una visualización de embeddings y correlaciones entre variables binarias del perfil y etiquetas de andamiaje.

Muestra: La muestra empírica es enteramente sintética: cuatro familias/versiones de LLM representan a docente y estudiante a partir de 100 descripciones de imágenes y producen 500 diálogos con 10.000 turnos. El artículo no desglosa con suficiente precisión cuántos diálogos corresponden a cada modelo, rasgo, polo, capacidad o imagen, ni cómo se combinaron simultáneamente los cinco rasgos. Dos expertos etiquetan 50 conversaciones para una comprobación limitada del juez automático. No participan niños, estudiantes, profesorado, psicólogos, centros educativos ni usuarios finales.

Hallazgos

  • BF-TC transforma los cinco rasgos en señales explícitas de conversación educativa, separadas en polos alto y bajo.
  • La capacidad lingüística se reduce a dos condiciones que prescriben respuestas completas y correctas frente a palabras, frases incompletas y errores gramaticales.
  • En cada diálogo, docente y estudiante son instancias del mismo modelo generador.
  • GPT-4-1106 se utiliza como juez uniforme incluso cuando GPT-4 también genera la conversación evaluada.
  • En 50 diálogos con etiquetas de dos expertos, la exactitud del juez GPT-4 es 0,78 para apertura, 0,90 para responsabilidad, 0,92 para extraversión, 0,80 para amabilidad y 0,92 para neuroticismo.
  • En clasificación BF-TC, GPT-4-1106 obtiene F1 medio 0,727; GPT-3.5-1106, 0,562; Zephyr 3-shot, 0,533; Vicuna, 0,528; y Zephyr zero-shot, 0,515.
  • El 3-shot de Zephyr no mejora de forma general: sube especialmente amabilidad y neuroticismo, pero baja apertura y extraversión.
  • GPT-4-1106 alcanza F1 0,741 en la etiqueta binaria de capacidad lingüística; GPT-3.5 queda en 0,660, Vicuna en 0,631 y Zephyr en 0,542.
  • Los ejemplos muestran que GPT-4 expresa baja extraversión mediante silencios, muletillas y vacilación, y alta extraversión mediante respuestas más extensas y entusiastas.
  • Un ejemplo del apéndice asigna baja amabilidad pero es clasificado como alta, una discrepancia coherente con los F1 imperfectos del sistema.
  • Sin especificar BF-TC, los autores observan un sesgo por defecto hacia polos altos de todos los rasgos salvo neuroticismo.
  • Las 500 respuestas BFI generadas producen alfa de Cronbach de 0,906 a 0,936, pero se obtienen de personas simuladas instruidas y no de una población humana.
  • Las correlaciones BFI son positivas entre apertura, responsabilidad, extraversión y amabilidad y negativas entre neuroticismo y las otras cuatro dimensiones.
  • La concordancia media BF-TC-BFI varía entre F1 0,725 para Zephyr y 0,802 para GPT-4; las dos representaciones proceden del mismo diálogo y del mismo agente simulado.
  • La condición de mayor capacidad se asocia con más feedback, instrucciones y preguntas; la de menor capacidad, con más pistas, explicaciones y modelado.
  • Las asociaciones entre BF-TC y andamiaje son visualmente más marcadas en la condición de menor capacidad.
  • El artículo sostiene que GPT-4 ajusta el andamiaje al perfil, pero ese docente conoce indirectamente las respuestas prescritas del estudiante dentro de una conversación enteramente generada.
  • El artículo reconoce limitación al inglés y riesgos abiertos de alucinación y sesgo.
  • No se identifica una publicación oficial de código, prompts ejecutables, semillas, imágenes, diálogos, etiquetas ni resultados tabulares completos.

Limitaciones

  • El estudio evalúa obediencia a descripciones de rol, no personalidad psicológica de un LLM ni de una persona.
  • BF-TC se define con las mismas señales lingüísticas y conductuales que luego busca el clasificador, lo que introduce circularidad por construcción.
  • Apertura se mezcla con creatividad, aceptación de ideas e interés por aprender; responsabilidad con organización, actitud y estrategias; extraversión con fluidez; amabilidad con interés y cortesía; y neuroticismo con confianza y tristeza.
  • Estas reformulaciones confunden rasgos con capacidad, motivación, participación, obediencia, afecto y deseabilidad social.
  • Los polos bajos se describen en términos normativamente negativos como desinterés, falta de cuidado, descortesía, desorganización y distracción, reforzando estereotipos sobre estudiantes introvertidos, ansiosos o menos afables.
  • La atribución de silencios, muletillas y vacilación a baja extraversión puede confundir personalidad con dominio lingüístico, ansiedad, discapacidad, cultura o estilo comunicativo.
  • El texto dice obtener inspiración de CHILDES, pero no documenta muestreo, análisis, ejemplos, anotaciones ni una derivación empírica reproducible desde ese corpus.
  • NAP se usa como inspiración para dos prompts extremos; no se administra ni valida el protocolo estandarizado en estudiantes.
  • No se comparan los perfiles generados con conversaciones auténticas de niños con medidas de personalidad y capacidad independientes.
  • No hay participantes humanos que reciban la tutoría, por lo que no existen resultados de aprendizaje, compromiso, satisfacción, seguridad o retención.
  • El mismo modelo interpreta al docente y al estudiante, creando dependencia estilística y de conocimiento entre los dos papeles.
  • GPT-4 juzga todos los modelos y puede juzgar sus propias generaciones; no hay un evaluador independiente para el conjunto completo.
  • La comprobación humana cubre solo 50 diálogos y no informa quiénes son los expertos, entrenamiento, cegamiento, etiquetas por experto, acuerdo interanotador, adjudicación ni distribución por condición.
  • Las exactitudes del juez humano-modelo no incluyen conteos, matriz de confusión, intervalos ni comparación con baselines.
  • El artículo no especifica si las etiquetas de los dos expertos se unieron por consenso, mayoría o contra una referencia individual.
  • No se explica de forma completa la composición de los 500 diálogos por modelo, imagen, nivel lingüístico y combinación de rasgos.
  • Las 100 imágenes se describen como open-sourced sin identificar fuentes, licencias, contenido o partición.
  • No se publican temperatura, top-p, semilla, límites de tokens, política de reintentos ni manejo de salidas inválidas.
  • Las versiones abiertas no incluyen identificadores exactos de checkpoints, revisiones, plantillas de chat ni versiones de librerías.
  • GPT-3.5-1106 y GPT-4-1106 son servicios cerrados y versionados por proveedor; las salidas no quedan congeladas en un artefacto público.
  • La condición few-shot se prueba solo en Zephyr y no incluye ejemplos alternativos, semillas ni un control equivalente de longitud.
  • Se informa que GPT-4 supera significativamente a otros modelos sin una prueba estadística sobre los F1 de la Tabla 2.
  • Los F1 por rasgo no tienen intervalos, variabilidad entre imágenes ni análisis de error sistemático.
  • La visualización de embeddings no especifica modelo de embedding, preprocesamiento, reducción dimensional, hiperparámetros ni métrica cuantitativa de separación.
  • Responder el BFI después de haber recibido descripciones explícitas de rasgos favorece cumplimiento del prompt y contamina una supuesta medida independiente.
  • La consistencia BF-TC-BFI usa como referencia otra clasificación derivada de la misma conversación y del mismo juez, no un criterio externo.
  • Un alfa de Cronbach alto en respuestas sintéticas condicionadas no establece validez de constructo, criterio, convergente ni predictiva en personas.
  • El criterio exacto para convertir las puntuaciones BFI en alto/bajo se describe ambiguamente como la media y no se justifica psicométricamente.
  • Las correlaciones entre escalas BFI reflejan una mezcla de prompts, respuestas generadas y scoring; no prueban la estructura factorial del instrumento.
  • No se realiza análisis factorial confirmatorio, invariancia, test-retest ni comparación con normas humanas.
  • Las múltiples correlaciones de rasgos y siete tipos de andamiaje no documentan corrección completa por multiplicidad, intervalos o tamaño muestral efectivo independiente.
  • Los turnos dentro de un mismo diálogo y los diálogos derivados de una misma imagen no son observaciones necesariamente independientes.
  • Las variables binarias prescritas hacen esperables las correlaciones con acciones docentes que responden directamente al texto generado.
  • No se compara el andamiaje con decisiones de docentes humanos ni se evalúa si la adaptación es pedagógicamente apropiada o beneficiosa.
  • Más feedback, pistas o preguntas no equivale por sí mismo a mejor enseñanza ni a personalización segura.
  • La sección ética declara que no prevé usos no éticos, pero no analiza perfilado de menores, estigmatización, sesgo cultural, privacidad, dependencia o decisiones educativas automatizadas.
  • Solo se trabaja en inglés y en una tarea de descripción de imágenes, con cuatro modelos de 2023; la generalización a otros idiomas, edades, asignaturas y modelos queda abierta.
  • Sin código, corpus generado y etiquetas no es posible recalcular tablas, figuras, correlaciones ni errores de clasificación.

Qué no demuestra

  • No demuestra que los LLM posean una personalidad Big Five interna o estable.
  • No demuestra que BF-TC sea una adaptación psicométricamente válida del Big Five.
  • No demuestra que interés por aprender, cortesía, fluidez o confianza sean proxies válidos y no sesgados de personalidad.
  • No demuestra que los perfiles simulados representen el comportamiento de estudiantes reales.
  • No demuestra que el BFI conserve validez cuando un LLM conoce por prompt el perfil esperado.
  • No demuestra que alfa de Cronbach alta equivalga a validez de constructo o realismo.
  • No demuestra que la concordancia BF-TC-BFI sea independiente del prompt y del juez compartidos.
  • No demuestra que GPT-4 sea un juez fiable fuera de los 50 diálogos comprobados ni en versiones actuales.
  • No demuestra superioridad estadística de GPT-4 sobre los demás modelos.
  • No demuestra que las asociaciones de andamiaje sean causales.
  • No demuestra que el andamiaje etiquetado sea correcto, personalizado, seguro o eficaz.
  • No demuestra mejora de aprendizaje, motivación, participación o bienestar.
  • No demuestra funcionamiento con docentes, estudiantes o imágenes reales en un ITS desplegado.
  • No demuestra generalización a otros rasgos, niveles continuos, idiomas, culturas, edades, tareas o modelos.
  • No permite auditar sesgos contra introversión, neuroticismo, baja afabilidad, discapacidad o variedades lingüísticas.
  • No permite reproducir los 500 diálogos ni los resultados sin los artefactos experimentales ausentes.

Trazabilidad

Alcance: Texto completo

Versión: EMNLP 2024 main-conference final proceedings paper, pp. 626-642, DOI 10.18653/v1/2024.emnlp-main.37, 17 pages; no official code or data release identified in the paper, ACL record, or targeted project search

Fuente consultada: https://aclanthology.org/2024.emnlp-main.37.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, educational-measurement, psychometric-circularity, LLM-judge, experimental-design, reproducibility, bias and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Zephyr-7B-beta
  • Zephyr-7B-beta con generación 3-shot
  • Vicuna-13B-v1.5
  • GPT-3.5-1106
  • GPT-4-1106
  • PyTorch y Hugging Face Transformers para los modelos abiertos
  • OpenAI API para GPT-3.5 y GPT-4

Instrumentos y métricas

  • Big Five for Tutoring Conversation (BF-TC), construido por los autores
  • Big Five Inventory (BFI), 44 ítems y escala Likert de 1 a 5
  • Narrative Assessment Protocol (NAP) como inspiración para cinco componentes lingüísticos
  • Clasificación binaria de capacidad lingüística alta o baja
  • Rúbrica de siete estrategias de andamiaje: feedback, pistas, instrucción, explicación, modelado, preguntas y apoyo socioemocional
  • Etiquetado GPT-4 de diálogo y de enunciado
  • Precisión, recall y F1
  • Alfa de Cronbach y correlación de Pearson
  • Visualización no especificada de embeddings de respuestas

Datos utilizados

  • 100 imágenes de dibujos animados descritas como open-sourced, sin colección, licencia ni identificadores publicados
  • 500 conversaciones de tutoría generadas, según el artículo
  • 10.000 enunciados generados, según el artículo
  • 50 diálogos seleccionados aleatoriamente y etiquetados por dos expertos para contrastar al juez GPT-4
  • 500 respuestas sintéticas al BFI usadas en el análisis psicométrico
  • No se usa ni publica un conjunto de datos de estudiantes o docentes reales

Evidencia y localización

  • Registro bibliográfico y abstract oficial: ACL Anthology 2024.emnlp-main.37: 4 authors, EMNLP 2024, pp. 626-642, DOI 10.18653/v1/2024.emnlp-main.37
  • Fuente completa auditada: .cache/editorial-sources/article-097/source.pdf; official ACL PDF; 17 pages; sha256 8d6a5da1a2b82239c27dc82a9960b9b891eeaa664c5994e01507c38b742d61b0
  • Definición cognitiva alta y baja: Full text pp. 628-629, section 3.1
  • Definición y supuestos de BF-TC: Full text pp. 629-630, section 3.2 and Table 1; appendix pp. 640-641, Tables 6-8
  • Prompts de docente y estudiante: Full text p. 630, Codeboxes C1-C2; appendix p. 639, validation instructions
  • Validación de rasgos, capacidad, BFI y andamiaje: Full text p. 630, section 3.3; appendix pp. 639 and 642, sections A.1-A.2 and Table 9
  • Cuatro modelos, roles y corpus generado: Full text p. 631, sections 4.1-4.2: same model for teacher and student, 100 images, 500 dialogues, 10K utterances
  • Comprobación humana del juez GPT-4: Full text p. 632, section 5.1: 50 randomly selected dialogues, two experts, five reported accuracies
  • Resultados BF-TC y capacidad lingüística: Full text p. 631, Tables 2-3
  • Resultados BFI y consistencia BF-TC-BFI: Full text pp. 632-633, Tables 4-5 and section 5.2
  • Sesgo por defecto sin BF-TC: Full text p. 632, footnote 1
  • Embeddings sin especificación reproducible: Full text p. 632, Figure 3; no embedding model or dimensionality-reduction method is stated elsewhere in the paper
  • Asociaciones con andamiaje: Full text pp. 633-634, Figures 4-5 and section 5.3
  • Ejemplos y discrepancia de amabilidad: Appendix pp. 641-642, Tables 8-9
  • Entorno computacional: Appendix p. 639, section A.2: single A100 80G, PyTorch, Hugging Face Transformers and OpenAI API
  • Limitaciones y declaración ética de autores: Full text p. 634, Limitations and Ethics and Impact Statement
  • Ausencia de artefacto reproducible: Paper and ACL metadata contain no project, code or data URL; targeted official GitHub/project search checked 15 Jul 2026
  • Comprobación visual integral: All 17 PDF pages rendered and visually inspected, including five result tables, five figures, prompts, validation instructions, dialogue examples, limitations and ethics; checked 15 Jul 2026