PATS propone que un tutor LLM no se limite a responder preguntas, sino que elija explícitamente estrategias pedagógicas en función de un perfil Big Five. Esta revisión usa la publicación definitiva en Findings of EACL 2026, DOI 10.18653/v1/2026.findings-eacl.219, páginas 4186–4211, y audita también el repositorio oficial donya-rooein/PATS en el commit 3924adf. El repositorio sí publica los 3.840 diálogos simulados, 1.920 por tarea, 120 valoraciones expertas y un demo, pero no el código de generación, los datos Prolific, las evaluaciones LLM, la muestra anotada de 100 diálogos ni un entorno reproducible completo.
El punto de partida real no es una intervención PATS con estudiantes. Los autores analizan primero datos privados de 110 participantes de 16–21 años, 281 chats de un tutor GPT-4o y un cuestionario Big Five de 44 ítems en un curso real. Concluyen cualitativamente que ese tutor usaba casi siempre preguntas y respuestas y que el engagement era bajo, pero no describen una codificación sistemática ni una métrica de engagement. En el apéndice atribuyen silencios a baja apertura/alto neuroticismo y lenguaje con viñetas a que el estudiante «summoned ChatGPT», apoyándose también en detectores de IA; son interpretaciones especulativas, no outcomes validados. PATS se evalúa después únicamente con estudiantes simulados, no con esos estudiantes reales.
La taxonomía enlaza 17 estrategias con cada rasgo OCEAN en nivel alto o bajo. Incluye scaffolding, motivación, instrucción directa, role-play, tono amistoso, elección, gamificación, relevancia real, seguimiento y otras. Su construcción parte de bibliografía educativa y filtra técnicas que no caben en tutoría individual. Sin embargo, la tabla convierte rasgos continuos en diez estereotipos binarios: por ejemplo, baja apertura se describe como «uncreative, inflexible, uninterested in learning» y baja amabilidad como «disinterested, inconsiderate, impolite, uncooperative». High Agreeableness copia características de High Openness y recomienda Collaborative Peer Teaching pese a que el propio filtro decía excluir estrategias dependientes de grupo. No hay revisión sistemática reproducible, panel de expertos, calidad de evidencia por mapping ni validación causal de que cada estrategia beneficie a ese perfil.
El experimento usa dos tareas para supuesto alumnado de tercer curso: describir diez imágenes de Freepik y comentar diez cuentos morales. Para cada tarea genera 32 combinaciones binarias de Big Five con tres tutores, 640 diálogos por sistema y 1.920 por tarea. Gemini-2.0-Flash simula al estudiante mediante dos pasos: genera cinco respuestas candidatas y luego selecciona la más coherente con el perfil. El mismo Gemini genera los tutores, incluidos PATS y sus dos baselines. PATS conoce el vector de personalidad verdadero, selecciona un rasgo, escoge una o varias estrategias permitidas y produce un plan que el Responder incorpora. El baseline de personalidad recibe el mismo perfil pero no la taxonomía; el simple no recibe el perfil. Por tanto se prueba generación condicionada con ground truth privilegiado, no detección fiable de personalidad a partir de una conversación real, aunque la Figura 1 y parte del texto hablen de «identificar» al estudiante.
Los modelos y parámetros tampoco están plenamente fijados. La generación y evaluación se hicieron de abril a mayo de 2025 con «GPT4o latest», Llama 3.3 70B en Together y Gemini-2.0-Flash en Google AI Studio, usando hiperparámetros por defecto. No se publican snapshots exactos, temperatura, top-p, max tokens, seeds, retries ni prompts/API completos como código ejecutable. Gemini se elige como simulador porque GPT-4o clasifica mejor sus rasgos en promedio, lo que introduce dependencia de un juez LLM y no valida realismo infantil. El simulador usa descriptores explícitos, body-language teatral y un segundo LLM que elige la respuesta más estereotípica; esto amplifica separabilidad por diseño.
La evidencia descriptiva más sólida es que PATS produce estilos diferentes y una gama más amplia de estrategias. Tres autores revisan 100 diálogos y reportan 94,6 % de éxito al «mencionar y explicar» al menos una estrategia seleccionada, con Cohen κ medio 0,610. Ese criterio verifica cumplimiento textual del plan, no aprendizaje, idoneidad pedagógica ni fidelidad al perfil. En los 640 diálogos PATS por tarea, motivación y scaffolding dominan; solo aparecen 12 de 17 estrategias, High Agreeableness nunca es seleccionado y Low Openness solo aparece una vez en los datos publicados. La Tabla 2 no contiene frecuencias literales: el JSON tiene 786 eventos de selección y 1.302 menciones de estrategia; al repartir cada evento entre sus k estrategias se obtienen frecuencias fraccionarias, 301,83 motivación, 167,33 scaffolding, etc., que el artículo trunca a enteros. Así las columnas impresas suman 783, no 786, sin explicar la ponderación.
Tres LLM, GPT-4o, Llama 3.3 70B y Gemini-2.0-Flash, comparan PATS con cada baseline en orden invertido; si cambia la respuesta se marca empate. En historias, Gemini y Llama favorecen PATS alrededor del 60 %, mientras GPT queda cerca de empate; en imágenes las preferencias PATS son menores y varias barras rondan 37–48 %. El caption afirma significancia mediante t-tests unilaterales, pero el repositorio no contiene las elecciones LLM ni el código de esos tests. El prompt del juez explica que ciertos tutores incorporan estrategias adaptadas, da ejemplos de sus beneficios y pide evitar empates, lo que puede inducir la preferencia que mide. Gemini además evalúa diálogos generados por Gemini.
La primera evaluación humana con 120 docentes de Prolific es explícitamente poco fiable: solo 42 % supera el control de atención y Fleiss κ es 0,14–0,16. Tras excluir fallos, PATS logra 54,7 % frente al baseline simple y 54,3 % frente al de personalidad; role-play/friendly llega a p=0,002 frente al simple pero p=0,060 frente al baseline de personalidad. Estos datos no se publican. La evaluación que sustenta la conclusión usa solo cuatro docentes expertos, todos con experiencia tecnológica/IA. Cada uno valora 30 comparaciones; hay 20 pares por baseline y tres votos por par. La mayoría favorece PATS: frente al simple, 17/20 en motivación, 15/20 en ajuste, proactividad y engagement, y 16/20 en empatía; frente al baseline de personalidad, 13/20 en motivación y ajuste, 12/20 en proactividad y engagement, y 15/20 en empatía. Es preferencia sobre textos sintéticos, no efecto en estudiantes.
Los JSON permiten reproducir esas mayorías expertas, pero el notebook no es ejecutable de extremo a extremo. Abre batch_Batch_*.json desde el directorio equivocado, espera una clave LLMChoices ausente en los cuatro archivos, no declara dependencias y conserva outputs generados con datos internos distintos. La función Fleiss ignora su parámetro y depende de la variable global i; además convierte empates en medios votos, creando conteos imposibles como 2,5 anotadores. Los binomiales cuentan tres votos repetidos por diálogo como ensayos independientes, convierten empate en medio éxito, redondean y no corrigen diez comparaciones. La sección rotulada Llama vuelve a usar results_L1/results_L2 humanos en lugar de results_L1_llama/results_L2_llama. Por ello las barras humanas son recuperables, pero no deben aceptarse las pruebas inferenciales del notebook ni las cifras LLM como reproducidas.
La aportación defendible es de diseño: hacer explícita una taxonomía y separar planificación de respuesta puede generar diálogos que jueces perciben como más motivadores, empáticos o adaptados que prompts menos estructurados. No se demuestra mejora de aprendizaje, retención, engagement real, equidad o bienestar. Tampoco se valida inferencia de personalidad ni uso seguro de perfiles psicológicos en menores. PATS debe presentarse como prototipo de prompting y corpus sintético preferido en comparaciones limitadas, no como tutor personalizado eficaz ya validado.