PATS: Personality-Aware Teaching Strategies with Large Language Model Tutors

Aplicaciones, sesgos y seguridad2026arXivRevisión editorial aprobada

Autores: Donya Rooein, Sankalan Pal Chowdhury, Mariia Eremeeva, Yuan Qin, Debora Nozza, Mrinmaya Sachan, Dirk Hovy

Palabras clave: Large Language Models, Personality, Persona, Model Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
17
Hallazgos
91
Limitaciones
13
Evidencias

Resumen editorial

Español

PATS propone que un tutor LLM no se limite a responder preguntas, sino que elija explícitamente estrategias pedagógicas en función de un perfil Big Five. Esta revisión usa la publicación definitiva en Findings of EACL 2026, DOI 10.18653/v1/2026.findings-eacl.219, páginas 4186–4211, y audita también el repositorio oficial donya-rooein/PATS en el commit 3924adf. El repositorio sí publica los 3.840 diálogos simulados, 1.920 por tarea, 120 valoraciones expertas y un demo, pero no el código de generación, los datos Prolific, las evaluaciones LLM, la muestra anotada de 100 diálogos ni un entorno reproducible completo.

El punto de partida real no es una intervención PATS con estudiantes. Los autores analizan primero datos privados de 110 participantes de 16–21 años, 281 chats de un tutor GPT-4o y un cuestionario Big Five de 44 ítems en un curso real. Concluyen cualitativamente que ese tutor usaba casi siempre preguntas y respuestas y que el engagement era bajo, pero no describen una codificación sistemática ni una métrica de engagement. En el apéndice atribuyen silencios a baja apertura/alto neuroticismo y lenguaje con viñetas a que el estudiante «summoned ChatGPT», apoyándose también en detectores de IA; son interpretaciones especulativas, no outcomes validados. PATS se evalúa después únicamente con estudiantes simulados, no con esos estudiantes reales.

La taxonomía enlaza 17 estrategias con cada rasgo OCEAN en nivel alto o bajo. Incluye scaffolding, motivación, instrucción directa, role-play, tono amistoso, elección, gamificación, relevancia real, seguimiento y otras. Su construcción parte de bibliografía educativa y filtra técnicas que no caben en tutoría individual. Sin embargo, la tabla convierte rasgos continuos en diez estereotipos binarios: por ejemplo, baja apertura se describe como «uncreative, inflexible, uninterested in learning» y baja amabilidad como «disinterested, inconsiderate, impolite, uncooperative». High Agreeableness copia características de High Openness y recomienda Collaborative Peer Teaching pese a que el propio filtro decía excluir estrategias dependientes de grupo. No hay revisión sistemática reproducible, panel de expertos, calidad de evidencia por mapping ni validación causal de que cada estrategia beneficie a ese perfil.

El experimento usa dos tareas para supuesto alumnado de tercer curso: describir diez imágenes de Freepik y comentar diez cuentos morales. Para cada tarea genera 32 combinaciones binarias de Big Five con tres tutores, 640 diálogos por sistema y 1.920 por tarea. Gemini-2.0-Flash simula al estudiante mediante dos pasos: genera cinco respuestas candidatas y luego selecciona la más coherente con el perfil. El mismo Gemini genera los tutores, incluidos PATS y sus dos baselines. PATS conoce el vector de personalidad verdadero, selecciona un rasgo, escoge una o varias estrategias permitidas y produce un plan que el Responder incorpora. El baseline de personalidad recibe el mismo perfil pero no la taxonomía; el simple no recibe el perfil. Por tanto se prueba generación condicionada con ground truth privilegiado, no detección fiable de personalidad a partir de una conversación real, aunque la Figura 1 y parte del texto hablen de «identificar» al estudiante.

Los modelos y parámetros tampoco están plenamente fijados. La generación y evaluación se hicieron de abril a mayo de 2025 con «GPT4o latest», Llama 3.3 70B en Together y Gemini-2.0-Flash en Google AI Studio, usando hiperparámetros por defecto. No se publican snapshots exactos, temperatura, top-p, max tokens, seeds, retries ni prompts/API completos como código ejecutable. Gemini se elige como simulador porque GPT-4o clasifica mejor sus rasgos en promedio, lo que introduce dependencia de un juez LLM y no valida realismo infantil. El simulador usa descriptores explícitos, body-language teatral y un segundo LLM que elige la respuesta más estereotípica; esto amplifica separabilidad por diseño.

La evidencia descriptiva más sólida es que PATS produce estilos diferentes y una gama más amplia de estrategias. Tres autores revisan 100 diálogos y reportan 94,6 % de éxito al «mencionar y explicar» al menos una estrategia seleccionada, con Cohen κ medio 0,610. Ese criterio verifica cumplimiento textual del plan, no aprendizaje, idoneidad pedagógica ni fidelidad al perfil. En los 640 diálogos PATS por tarea, motivación y scaffolding dominan; solo aparecen 12 de 17 estrategias, High Agreeableness nunca es seleccionado y Low Openness solo aparece una vez en los datos publicados. La Tabla 2 no contiene frecuencias literales: el JSON tiene 786 eventos de selección y 1.302 menciones de estrategia; al repartir cada evento entre sus k estrategias se obtienen frecuencias fraccionarias, 301,83 motivación, 167,33 scaffolding, etc., que el artículo trunca a enteros. Así las columnas impresas suman 783, no 786, sin explicar la ponderación.

Tres LLM, GPT-4o, Llama 3.3 70B y Gemini-2.0-Flash, comparan PATS con cada baseline en orden invertido; si cambia la respuesta se marca empate. En historias, Gemini y Llama favorecen PATS alrededor del 60 %, mientras GPT queda cerca de empate; en imágenes las preferencias PATS son menores y varias barras rondan 37–48 %. El caption afirma significancia mediante t-tests unilaterales, pero el repositorio no contiene las elecciones LLM ni el código de esos tests. El prompt del juez explica que ciertos tutores incorporan estrategias adaptadas, da ejemplos de sus beneficios y pide evitar empates, lo que puede inducir la preferencia que mide. Gemini además evalúa diálogos generados por Gemini.

La primera evaluación humana con 120 docentes de Prolific es explícitamente poco fiable: solo 42 % supera el control de atención y Fleiss κ es 0,14–0,16. Tras excluir fallos, PATS logra 54,7 % frente al baseline simple y 54,3 % frente al de personalidad; role-play/friendly llega a p=0,002 frente al simple pero p=0,060 frente al baseline de personalidad. Estos datos no se publican. La evaluación que sustenta la conclusión usa solo cuatro docentes expertos, todos con experiencia tecnológica/IA. Cada uno valora 30 comparaciones; hay 20 pares por baseline y tres votos por par. La mayoría favorece PATS: frente al simple, 17/20 en motivación, 15/20 en ajuste, proactividad y engagement, y 16/20 en empatía; frente al baseline de personalidad, 13/20 en motivación y ajuste, 12/20 en proactividad y engagement, y 15/20 en empatía. Es preferencia sobre textos sintéticos, no efecto en estudiantes.

Los JSON permiten reproducir esas mayorías expertas, pero el notebook no es ejecutable de extremo a extremo. Abre batch_Batch_*.json desde el directorio equivocado, espera una clave LLMChoices ausente en los cuatro archivos, no declara dependencias y conserva outputs generados con datos internos distintos. La función Fleiss ignora su parámetro y depende de la variable global i; además convierte empates en medios votos, creando conteos imposibles como 2,5 anotadores. Los binomiales cuentan tres votos repetidos por diálogo como ensayos independientes, convierten empate en medio éxito, redondean y no corrigen diez comparaciones. La sección rotulada Llama vuelve a usar results_L1/results_L2 humanos en lugar de results_L1_llama/results_L2_llama. Por ello las barras humanas son recuperables, pero no deben aceptarse las pruebas inferenciales del notebook ni las cifras LLM como reproducidas.

La aportación defendible es de diseño: hacer explícita una taxonomía y separar planificación de respuesta puede generar diálogos que jueces perciben como más motivadores, empáticos o adaptados que prompts menos estructurados. No se demuestra mejora de aprendizaje, retención, engagement real, equidad o bienestar. Tampoco se valida inferencia de personalidad ni uso seguro de perfiles psicológicos en menores. PATS debe presentarse como prototipo de prompting y corpus sintético preferido en comparaciones limitadas, no como tutor personalizado eficaz ya validado.

English

PATS proposes that an LLM tutor should explicitly choose pedagogical strategies from a Big Five profile rather than merely answer questions. This review uses the definitive Findings of EACL 2026 publication, DOI 10.18653/v1/2026.findings-eacl.219, pages 4186–4211, and audits the official donya-rooein/PATS repository at commit 3924adf. The repository does release 3,840 simulated dialogues, 1,920 per task, 120 expert ratings, and a demo, but not the generation code, Prolific data, LLM evaluations, the 100-dialog author annotation sample, or a complete reproducible environment.

The real starting point is not a PATS intervention with students. The authors first examine private data from 110 participants aged 16–21, 281 GPT-4o tutor chats, and a 44-item Big Five questionnaire in a real course. They qualitatively conclude that the tutor mostly used question answering and that engagement was low, but provide no systematic coding procedure or engagement measure. In the appendix they attribute silence to low openness/high neuroticism and bullet-formatted language to the student having “summoned ChatGPT,” partly invoking AI detectors. These are speculative interpretations, not validated outcomes. PATS is subsequently evaluated only with simulated students, not those real learners.

The taxonomy links 17 strategies to each high or low OCEAN trait. It includes scaffolding, encouragement, direct instruction, role-play, friendly tone, choice, gamification, real-world relevance, progress tracking, and others. It draws on educational literature and filters techniques unsuitable for one-to-one tutoring. However, it turns continuous traits into ten binary stereotypes: low openness is described as “uncreative, inflexible, uninterested in learning,” and low agreeableness as “disinterested, inconsiderate, impolite, uncooperative.” High Agreeableness duplicates High Openness characteristics and recommends Collaborative Peer Teaching even though the filter claims to exclude group-dependent methods. There is no reproducible systematic review, expert panel, evidence grading per mapping, or causal validation that each strategy benefits the assigned profile.

The experiment uses two nominal third-grade tasks: describing ten Freepik images and discussing ten moral stories. For each task it generates all 32 binary Big Five combinations under three tutors, producing 640 dialogues per system and 1,920 per task. Gemini-2.0-Flash simulates the student in two stages: it generates five candidate replies and then selects the one most consistent with the profile. The same Gemini backend generates the tutors, including PATS and both baselines. PATS receives the true personality vector, chooses one trait, selects one or more permitted strategies, and creates a plan for the Responder. The personality baseline receives the same profile without the taxonomy; the simple baseline does not receive it. This tests privileged ground-truth conditioning, not reliable personality detection from real conversation, despite Figure 1 and parts of the text describing student “identification.”

Models and parameters are not fully pinned. Generation and evaluation ran from April to May 2025 using “GPT4o latest,” Llama 3.3 70B through Together, and Gemini-2.0-Flash through Google AI Studio with default hyperparameters. Exact snapshots, temperature, top-p, token limits, seeds, retries, and executable API code are not published. Gemini is selected as student simulator because GPT-4o classifies its traits better on average, creating LLM-judge dependence rather than validating child realism. The simulator uses explicit descriptors, theatrical body-language cues, and a second LLM call that chooses the most stereotypically profile-consistent response, making traits separable by construction.

The strongest descriptive evidence is that PATS produces different styles and a broader strategy range. Three authors review 100 dialogues and report 94.6% success at “mentioning and explaining” at least one selected strategy, with mean Cohen's kappa 0.610. That criterion verifies textual plan compliance, not learning, pedagogical appropriateness, or profile fidelity. Across the published PATS data, motivation and scaffolding dominate; only 12 of 17 strategies appear, High Agreeableness is never selected, and Low Openness appears once. Table 2 does not report literal frequencies: the JSON contains 786 selection events and 1,302 strategy mentions. Fractionally allocating each event across its k strategies yields 301.83 for motivation, 167.33 for scaffolding, and so forth; the paper truncates these to integers. Printed frequencies therefore total 783 rather than 786 without documenting the weighting rule.

Three LLM judges, GPT-4o, Llama 3.3 70B, and Gemini-2.0-Flash, compare PATS against each baseline in both orders; an order-dependent answer becomes a tie. For stories, Gemini and Llama favor PATS at roughly 60%, while GPT is close to a tie; image preferences are smaller, with several PATS bars around 37–48%. The caption claims significance from one-sided t-tests, but the repository contains neither the LLM choices nor the test code. The judge prompt explains that some tutors use targeted adaptive strategies, gives examples of their benefits, and discourages ties, potentially priming the measured preference. Gemini also evaluates Gemini-generated dialogues.

The initial human evaluation with 120 Prolific teachers is explicitly unreliable: only 42% pass the attention check and Fleiss kappa is 0.14–0.16. After exclusions, PATS receives 54.7% preference over the simple baseline and 54.3% over the personality baseline; role-play/friendly reaches p=0.002 over simple but p=0.060 over personality. Those data are not released. The evaluation supporting the conclusion uses only four expert teachers, all experienced with technology/AI. Each rates 30 comparisons, with 20 pairs per baseline and three votes per pair. Majorities favor PATS: against simple, 17/20 for motivation, 15/20 for personality fit, proactivity, and engagement, and 16/20 for empathy; against personality, 13/20 for motivation and fit, 12/20 for proactivity and engagement, and 15/20 for empathy. These are preferences over synthetic text, not student effects.

The JSON files reproduce those expert majorities, but the notebook is not executable end to end. It opens batch_Batch_*.json from the wrong directory, expects an LLMChoices key absent from all four released files, declares no environment, and retains outputs produced with different internal data. Its Fleiss function ignores its argument and captures a global i; it also converts ties into half-votes, creating impossible counts such as 2.5 annotators. Binomial tests treat three repeated ratings per dialogue as independent trials, score a tie as half a success, round the total, and do not correct ten comparisons. The section labeled Llama reuses human results_L1/results_L2 instead of results_L1_llama/results_L2_llama. Human chart proportions are recoverable, but the notebook's inference and LLM results should not be considered reproduced.

The defensible contribution is a design result: explicitly providing a taxonomy and separating strategy planning from response generation can produce dialogues that limited judges perceive as more motivating, empathetic, or adapted than less structured prompts. The study does not demonstrate improved learning, retention, real engagement, equity, or well-being. It also does not validate personality inference or safe psychological profiling of minors. PATS should be presented as a prompting prototype and synthetic corpus preferred in limited comparisons, not as an already validated effective personalized tutor.

Pregunta de investigación

¿Puede un tutor LLM que conoce un perfil Big Five y selecciona explícitamente estrategias pedagógicas producir diálogos simulados percibidos como mejor adaptados que un prompt simple o un tutor que conoce el perfil pero no recibe una taxonomía?

Método

Se deriva una taxonomía de 17 estrategias para diez estados Big Five alto/bajo. Gemini-2.0-Flash simula alumnado de tercer curso y genera tres versiones de cada diálogo, simple, personality prompt y PATS, en diez imágenes y diez cuentos, para 32 perfiles binarios y 3.840 diálogos. Tres LLM evalúan preferencias por pares con orden invertido. Tres autores anotan 100 diálogos para cumplimiento de estrategia; 120 docentes Prolific hacen una evaluación preliminar poco fiable; cuatro docentes expertos puntúan 40 pares en cinco dimensiones.

Muestra: La generación factorial cubre dos tareas × diez temas × 32 perfiles × tres tutores = 3.840 diálogos. El análisis de implementación usa 100 diálogos elegidos aleatoriamente sin seed. El estudio Prolific recluta 120 docentes, pero solo 42 % supera el control. El estudio experto incluye cuatro docentes y 40 pares; cada docente valora 30 y cada par recibe tres votos. No hay estudiantes reales expuestos a PATS ni medidas de aprendizaje.

Hallazgos

  • El repositorio contiene exactamente 320 diálogos para cada combinación tarea × sistema, cubriendo los 32 perfiles diez veces.
  • Tres autores reportan 94,6 % de cumplimiento textual de al menos una estrategia planificada en 100 diálogos, con Cohen κ medio 0,610.
  • Motivational Encouragement y Step-by-Step Scaffolding dominan la selección de PATS.
  • Solo 12 de 17 estrategias aparecen en los diálogos publicados.
  • High Agreeableness nunca es seleccionado por el Strategizer y Low Openness aparece una sola vez.
  • La Tabla 2 representa 786 eventos mediante ponderación fraccional por número de estrategias y truncamiento; los enteros impresos suman 783.
  • En historias, Gemini y Llama favorecen PATS alrededor del 60 %, mientras GPT-4o queda cerca del empate.
  • En imágenes, las preferencias LLM son más débiles y varias tasas PATS están entre 37 % y 48 %.
  • El acuerdo entre jueces LLM se reporta en Fleiss κ 0,35–0,41 usando ejecuciones invertidas del mismo modelo como si fueran evaluadores separados.
  • En Prolific, solo 42 % supera la atención y Fleiss κ es 0,14–0,16.
  • La preferencia Prolific agregada es 54,7 % frente al simple y 54,3 % frente al personality baseline.
  • Role-play/Friendly es significativo frente al simple (p=0,002) pero no frente al personality baseline (p=0,060).
  • Frente al simple, expertos favorecen PATS en 17/20 pares para motivación y 15–16/20 en las otras dimensiones.
  • Frente al baseline de personalidad, expertos favorecen PATS en 12–15/20 pares según dimensión.
  • Los porcentajes mayoritarios de expertos se reproducen desde los cuatro JSON publicados.
  • El notebook no puede reproducir las preferencias LLM ni sus tests con los datos publicados.
  • PATS cambia la forma de los diálogos y aumenta estrategias explícitas, pero el estudio no mide aprendizaje.

Limitaciones

  • La evaluación principal de PATS no incluye estudiantes reales.
  • Los 110 estudiantes y 281 chats reales solo motivan el problema y no reciben la intervención.
  • No se define una métrica cuantitativa de engagement para el aula real.
  • La afirmación de baja participación procede de análisis cualitativo sin protocolo de codificación.
  • No se informan codificadores, rúbrica, desacuerdos o fiabilidad para los 281 chats.
  • Atribuir silencios a apertura/neuroticismo es especulativo y puede patologizar conducta ambigua.
  • Inferir uso de ChatGPT por viñetas, lenguaje elaborado y detectores de IA no es una verificación fiable.
  • Los datos reales son privados y no pueden auditarse.
  • El paper dice high si >3, mientras la Figura 5 dice high si ≥3 y low si ≤3.
  • Un score exactamente 3 queda sin clasificar en una regla y pertenece a ambos grupos en la otra.
  • Dichotomizar Big Five pierde información y puede crear perfiles artificialmente distintos.
  • Los diez perfiles más comunes se usan para evaluación humana, introduciendo selección por prevalencia.
  • La taxonomía no se deriva mediante una revisión sistemática reproducible.
  • No se publican términos de búsqueda, bases, screening, fechas o diagrama de inclusión.
  • No hay evaluación de calidad o fuerza de evidencia por mapping.
  • No se consultó un panel independiente de docentes o psicómetras para validar la taxonomía.
  • La bibliografía citada relaciona rasgos, preferencias y outcomes, pero no siempre prueba que la estrategia asignada cause beneficio.
  • Los descriptores de rasgos bajos son peyorativos y estereotípicos.
  • Low Openness se equipara a falta de creatividad, inflexibilidad y desinterés.
  • Low Agreeableness se equipara a desconsideración, descortesía y falta de cooperación.
  • High Agreeableness repite características de High Openness en la Tabla 1.
  • Collaborative Peer Teaching se mantiene aunque el filtro declara excluir estrategias grupales.
  • La taxonomía no modela interacción entre cinco rasgos, contexto, cultura, idioma, edad, capacidad o discapacidad.
  • El Strategizer actúa sobre un solo rasgo cada vez y puede ignorar tensiones del perfil completo.
  • PATS recibe el perfil verdadero; no tiene que inferirlo de conversación.
  • La supuesta detección de personalidad mostrada en Figura 1 no se evalúa como parte del pipeline PATS.
  • Aplicar el sistema real requeriría cuestionario o inferencia psicológica con riesgos de privacidad, consentimiento y error.
  • El simulador conoce descripciones explícitas de personalidad y está instruido para representarlas.
  • Cada turno de estudiante se selecciona entre cinco candidatos por coherencia con el perfil, amplificando estereotipos.
  • La selección de respuesta no evalúa realismo de edad, conocimiento, pedagogía o diversidad, solo consistencia de persona.
  • GPT-4o juzga la personalidad de outputs que se usan para elegir Gemini como simulador, generando dependencia de juez.
  • F1 de identificación de rasgo no equivale a fidelidad conductual o humana.
  • No hay comparación del simulador con respuestas de niños reales.
  • El mismo Gemini genera estudiante, PATS y baselines, creando estilo y errores compartidos.
  • Gemini también actúa como juez sobre diálogos producidos por Gemini.
  • Los modelos se identifican como GPT4o latest, Gemini-2.0-Flash y Llama 3.3 70B sin snapshots completos.
  • Se usan hiperparámetros por defecto, que pueden cambiar por proveedor y fecha.
  • No se informan temperatura, top-p, max tokens, seed, safety settings, retries o respuestas fallidas.
  • No hay código de generación ni configuración API en el repositorio.
  • No hay requirements.txt, lockfile, pyproject o instrucciones ejecutables del entorno.
  • La evaluación solo está en inglés y en dos tareas estrechas para tercer curso.
  • Las imágenes son AI-generated y se hotlinkean desde Freepik sin snapshot ni metadatos de licencia por elemento.
  • Los cuentos proceden de un sitio externo y no se discute representatividad cultural o licencia detallada.
  • No hay control de contenido dañino, sesgos culturales o adecuación de las historias/imágenes.
  • El criterio 94,6 % solo exige que el output mencione y explique alguna estrategia seleccionada.
  • Cumplimiento del plan no mide calidad, adecuación, aprendizaje ni beneficio para el perfil.
  • Los tres anotadores de cumplimiento son autores, sin evaluación independiente.
  • La muestra aleatoria de 100 no tiene seed ni IDs publicados.
  • Las etiquetas de esa muestra no están en el repositorio.
  • El promedio Cohen κ=0,610 no se desglosa por estrategia, tarea o annotator pair.
  • PATS solo utiliza 12 de 17 estrategias, mostrando cobertura incompleta.
  • High Agreeableness nunca se selecciona y Low Openness casi nunca, pese a evaluar los 32 perfiles equilibradamente.
  • La Tabla 2 llama frecuencias a asignaciones fraccionarias truncadas sin documentar la fórmula.
  • Los enteros de Tabla 2 suman 783 aunque el JSON contiene 786 eventos de selección.
  • El prompt de evaluación LLM explica las ventajas esperadas de estrategias personalizadas y puede primar PATS.
  • Se pide a los jueces LLM evitar Both are Equal, sesgando contra el empate.
  • Tratar el cambio al invertir orden como empate conserva order sensitivity sin modelarla.
  • El mismo modelo con dos órdenes se trata como evaluadores separados para Fleiss κ, aunque no son independientes.
  • La Figura 3 usa t-tests unilaterales sobre preferencias categóricas sin justificar unidad, normalidad o independencia.
  • No se publican datos ni código de los tests LLM.
  • No se corrigen claramente las múltiples comparaciones por modelo, tarea y baseline.
  • El estudio Prolific falla su propio control: solo 42 % pasa atención.
  • Fleiss κ 0,14–0,16 muestra acuerdo muy bajo en Prolific.
  • Excluir fallos de atención después del resultado puede cambiar la población evaluada.
  • Los datos Prolific no se publican para verificar exclusiones, pagos o tests.
  • Cuatro expertos son una muestra muy pequeña y todos declaran experiencia Tech/AI.
  • Cada experto evalúa 30 pares, por lo que sus votos repetidos no son independientes.
  • Cada uno de los 40 pares recibe tres votos y las cinco dimensiones comparten el mismo texto y evaluadores.
  • Los porcentajes por mayoría se basan solo en 20 pares por baseline.
  • No se modelan efectos de docente, diálogo, tarea o personalidad en un análisis multinivel.
  • Los tests binomiales del notebook tratan votos repetidos como 60 ensayos independientes por dimensión.
  • El notebook asigna medio éxito a empate y redondea antes del test binomial.
  • No corrige diez tests humanos de dimensión × baseline.
  • La función Fleiss del notebook ignora el parámetro index y depende de una variable global i.
  • El cálculo Fleiss convierte empates en medios votos y produce conteos no enteros de anotadores.
  • El notebook busca batch_Batch_i.json fuera de Data/Survey si se ejecuta desde su ubicación.
  • Los JSON publicados no contienen la clave LLMChoices que requieren varias celdas.
  • El notebook conserva outputs producidos con una versión interna de datos distinta de la publicada.
  • La sección de binomiales para Llama usa por error los diccionarios humanos results_L1/results_L2.
  • No hay tests automatizados, CI analítica o validación de esquema de los JSON.
  • El README afirma incluir code/scripts y datos para reproducir figuras, pero el alcance real es parcial.
  • La cita del README sigue siendo arXiv y no la publicación EACL definitiva.
  • La licencia raíz MIT no aclara la coexistencia con diálogos Gemini declarados CC BY 4.0 y assets externos.
  • No se miden exactitud de contenido, aprendizaje, pre/post, retención, transferencia o tiempo de tarea.
  • No se mide engagement conductual real, abandono, satisfacción del estudiante o carga cognitiva.
  • Preferencia de texto por un juez no equivale a eficacia pedagógica.
  • Respuestas más largas, proactivas o explícitas pueden ganar preferencias aunque no mejoren aprendizaje.
  • No se evalúan efectos adversos de etiquetar o tratar a un alumno según un perfil posiblemente erróneo.
  • Los detalles de IRB se retienen; se declara aprobación, pero no puede verificarse protocolo, consentimiento o assent.
  • La muestra real incluye posiblemente menores, pero no se detallan consentimiento parental ni manejo por edad.
  • La generalización a otros idiomas, edades, culturas, materias, necesidades especiales o aulas permanece sin probar.

Qué no demuestra

  • No establece que adaptar estrategias a Big Five mejore aprendizaje o retención.
  • No demuestra mayor engagement real en estudiantes.
  • No valida PATS mediante una intervención controlada en aula.
  • No demuestra que su taxonomía sea correcta, completa o causal.
  • No valida que rasgos bajos impliquen los comportamientos estereotípicos usados en prompts.
  • No demuestra que un LLM pueda inferir con fiabilidad la personalidad de un alumno real.
  • No demuestra seguridad, equidad o beneficio del perfilado psicológico de menores.
  • No establece que outputs de Gemini simulen fielmente alumnado de tercer curso.
  • No demuestra que cumplimiento textual de una estrategia sea implementación pedagógica efectiva.
  • No demuestra que role-play sea de alto impacto en aprendizaje; solo obtiene preferencia limitada en ciertos contrastes.
  • No establece significancia reproducible de las evaluaciones LLM con los artefactos públicos.
  • No convierte el estudio Prolific en evidencia fiable después de 42 % de atención y κ bajo.
  • No generaliza desde cuatro expertos y 40 pares a docentes o estudiantes en conjunto.
  • No permite reproducir el pipeline completo, costes, modelos y estadísticas desde el repositorio.
  • No justifica desplegar PATS como tutor autónomo o sustituto docente.

Trazabilidad

Alcance: Texto completo

Versión: Findings of EACL 2026, DOI 10.18653/v1/2026.findings-eacl.219, pp. 4186–4211; 26 pages

Fuente consultada: https://aclanthology.org/2026.findings-eacl.219.pdf

Revisión: Codex full-text, bilingual-fidelity, definitive-ACL, 26-page visual, taxonomy-evidence, simulator-validity, classroom-claim, human-sampling, LLM-judge, statistical-independence, repository-code, notebook, JSON-coverage, frequency-recomputation, licensing and artifact-reproducibility audit; data validation and quality controls applied, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Google Gemini-2.0-Flash via Google AI Studio, exact dated snapshot not reported, used for all student and tutor dialogue generation
  • OpenAI GPT-4o latest via API, queried April–May 2025, exact snapshot not reported, used as personality classifier and dialogue judge
  • Meta Llama 3.3 70B via together.ai, exact provider snapshot not reported, used as dialogue judge
  • Gemini-2.0-Flash used again as dialogue judge over Gemini-generated conversations

Instrumentos y métricas

  • 44-item Big Five questionnaire scored on a 1–5 scale in the private classroom dataset
  • Binary high/low OCEAN profile construction with an internally inconsistent threshold at score 3
  • Author-built taxonomy mapping 17 pedagogical strategies to ten high/low trait states
  • Two-stage Gemini student simulator: five candidate utterances followed by profile-consistency selection
  • PATS Strategizer: trait selection, strategy selection, and implementation planning
  • PATS Responder with last four utterances plus summary of earlier context
  • Simple-prompt and personality-aware prompt baselines
  • Image-description and moral-story tasks for a nominal third-grade learner
  • GPT-4o personality classification F1 used to select the simulator backend
  • Three-author binary assessment of whether any planned strategy is mentioned and explained
  • Pairwise LLM preference with reversed order and order disagreement converted to tie
  • Five expert dimensions: motivation/support, personality suitability, proactivity, engagement, and empathy
  • Prolific attention checks and expert-teacher majority voting

Datos utilizados

  • Private classroom data: 110 participants aged 16–21, Big Five surveys, and 281 anonymized GPT-4o tutor chats
  • Ten Freepik image subjects and ten children’s moral-story subjects
  • 3,840 released synthetic dialogues: 320 profiles/subjects × 3 systems × 2 tasks
  • 640 PATS dialogues per task with strategy-plan records
  • Author annotation sample of 100 dialogues, labels not released
  • Preliminary Prolific study with 120 teachers and 200 dialogue comparisons, raw data not released
  • Expert study with four teachers, 40 unique pairs, three ratings per pair, and 120 released comparison records
  • Official repository donya-rooein/PATS at commit 3924adf32ab21ae79e027ffc6711798d56c3d0ba

Evidencia y localización

  • Publicación definitiva, DOI y páginas: ACL Anthology 2026.findings-eacl.219, DOI 10.18653/v1/2026.findings-eacl.219, pp. 4186–4211
  • Datos reales de aula y umbral Big Five: Findings EACL paper, Section 2 and Appendix B–C
  • Taxonomía y mappings: Findings EACL paper, Section 3, Tables 1 and 6
  • Student model, PATS and baselines: Findings EACL paper, Sections 4.1–4.3 and Appendix E
  • Tareas, 32 perfiles y 3,840 diálogos: Findings EACL paper, Section 4.4; official repository Data/Tasks
  • Modelos, fechas y parámetros por defecto: Findings EACL paper, Appendix A
  • Cumplimiento de estrategia y distribución: Findings EACL paper, Section 5.1, Tables 2 and Figures 2; repository Data/Tasks/*_L3.json
  • Ponderación implícita de Tabla 2: Independent recomputation from 786 strategy-selection records in official repository commit 3924adf; 1/k allocation reproduces the printed frequencies before truncation
  • Evaluación LLM y prompts de jueces: Findings EACL paper, Sections 4.5 and 5.2, Figure 3, Appendix F.1.4 and F.2.2
  • Prolific y baja fiabilidad: Findings EACL paper, Section 5.2 and Appendix F.1
  • Cuatro expertos y mayorías: Findings EACL paper, Section 5.2, Figure 4, Table 7; repository Data/Survey/batch_Batch_1–4.json
  • Fallos de reproducibilidad y código del notebook: Official repository commit 3924adf, Analysis/Analysis Expert Annotation.ipynb and released Data/Survey schema, audited 15 July 2026
  • Limitaciones y ética declaradas: Findings EACL paper, Limitations and Ethical Considerations sections