Automatic Scoring of an Open-Response Measure of Advanced Mind-Reading Using Large Language Models

Evaluación y validez psicométrica2025ACL AnthologyRevisión editorial aprobada

Autores: Yixiao Wang, Russel Dsouza, Robert Lee, Ian Apperly, Rory T. Devine, Sanne W. van der Kleij, Mark Lee

Palabras clave: Large Language Models, Theory of Mind, Psychometrics, Automated Scoring, Open-Response Assessment, LLM Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
13
Hallazgos
23
Limitaciones
11
Evidencias

Resumen editorial

Español

Este trabajo de CLPsych 2025 no estudia personalidad ni teoría de la mente dentro de los LLM: usa modelos como calificadores binarios de respuestas humanas abiertas a diez narrativas sociales que pretenden medir mind-reading avanzado. Participaron 1.733 personas de 13 a 30 años, en centros educativos o Prolific. Un lead coder y cuatro codificadores entrenados asignaron etiquetas; antes de trabajar independientemente alcanzaron κ>0,7 frente al lead y este resolvió discrepancias. Cada prompt contiene narrativa, pregunta, rúbrica detallada y respuesta; el modelo devuelve 0/1. El paper compara plain/XML/JSON, tres versiones de rúbrica, zero-shot, 10-shot, 50-shot y fine-tuning. Declara 89,4 % macro de accuracy para GPT-4o zero-shot y 92,8 % tras fine-tuning, con κ=0,83. RoBERTa-large alcanza 92,0 %, GPT-4o-mini 90,5 %, Llama-3.2-3B 91,1 %, Mistral 88,7 %, Phi-3.5 83,8 %, Phi-4 87,5 % y Longformer 86,7 %. La augmentación mediante paráfrasis GPT-4o ayuda a Longformer, Mistral y Phi-3.5, apenas cambia Phi-4 y perjudica ligeramente a Llama. Son resultados prometedores para imitar una rúbrica fija, pero la auditoría del artefacto impide la interpretación amplia del artículo. El código genera 17.330 oportunidades de respuesta, elimina aleatoriamente 3.078 de la clase mayoritaria antes de dividir y publica 14.252 filas equilibradas. La partición real es 11.543/1.283/1.426, 80,99 %/9,00 %/10,01 %, no 80/10/10. Además, el pipeline descarta los IDs de participante antes de `train_test_split`; como cada persona responde las diez narrativas, sus estilos pueden aparecer en train y test. Los diez ítems y sus rúbricas están en los tres splits, por lo que el experimento mide nuevas respuestas a ítems conocidos, no transferencia a nuevos ítems o instrumentos. El dataset contiene tres prompts idénticos entre train/validation y uno entre train/test. Aunque test es 50/50 global, sus baselines mayoritarios por ítem promedian 62,03 % y varían de 50,32 % a 77,70 %; Llama zero-shot 64,3 % queda solo 2,27 puntos por encima. El paper llama significativas varias diferencias sin tests, intervalos, repeticiones o bootstrap por participante e ítem. La comparación humana es todavía más problemática: calcula kappa solo en casos donde GPT-4o y el codificador discrepaban, condicionando la muestra, y usa al lead coder como referencia. El texto dice que GPT-4o gana salvo en el ítem 5, pero Table 10 muestra que el humano también gana en el 3 y no contiene el ítem 7 que la prosa enumera. El repositorio tampoco reproduce el headline: carece de pipeline OpenAI, predicciones, resultados, código few-shot/formato y BERT/RoBERTa; el dataset de paráfrasis devuelve 401, falta `requirements.txt`, los scripts tienen rutas rotas, README intercambia enlaces Phi/Mistral y hay checkpoints incompletos. La conclusión defendible es que modelos ajustados pueden aproximar el criterio de un lead coder para diez preguntas conocidas en un corpus reducido y balanceado. No se valida el test, la generalización a participantes nuevos, ítems nuevos, grupos demográficos o clínicas, ni el uso como herramienta de cribado.

English

This CLPsych 2025 paper does not study personality or theory of mind inside LLMs; it uses models as binary graders of human open-ended answers to ten social narratives intended to measure advanced mind-reading. A total of 1,733 people aged 13-30 participated through schools or Prolific. One lead coder and four trained coders assigned labels; before independent coding they reached kappa greater than .7 against the lead, who resolved discrepancies. Each prompt includes the narrative, question, detailed rubric, and answer, and the model returns 0/1. The paper compares plain/XML/JSON, three rubric versions, zero-shot, 10-shot, 50-shot, and fine-tuning. It reports 89.4% macro accuracy for zero-shot GPT-4o and 92.8% after fine-tuning, with kappa .83. RoBERTa-large reaches 92.0%, GPT-4o-mini 90.5%, Llama-3.2-3B 91.1%, Mistral 88.7%, Phi-3.5 83.8%, Phi-4 87.5%, and Longformer 86.7%. GPT-4o paraphrase augmentation helps Longformer, Mistral, and Phi-3.5, barely changes Phi-4, and slightly harms Llama. These are promising fixed-rubric imitation results, but artifact audit blocks the paper's broader interpretation. Code creates 17,330 response opportunities, randomly removes 3,078 majority-class rows before splitting, and publishes 14,252 balanced rows. The actual split is 11,543/1,283/1,426-80.99%/9.00%/10.01%, not 80/10/10. The pipeline also drops participant IDs before `train_test_split`; because each person answers all ten narratives, participant-specific style can occur in train and test. All ten items and rubrics appear in every split, so the experiment tests new answers to known items rather than transfer to new items or instruments. Three exact prompts overlap train/validation and one overlaps train/test. Although test is globally 50/50, its per-item majority baselines average 62.03% and range from 50.32% to 77.70%; zero-shot Llama at 64.3% is only 2.27 points higher. The paper calls several differences significant without tests, intervals, replications, or participant/item bootstrap. Its human comparison is more problematic: kappa is computed only on cases where GPT-4o and the coder disagreed, conditioning the sample, with the lead coder as reference. The prose says GPT-4o wins except on item 5, but Table 10 also has the human ahead on item 3 and contains no item 7 despite listing it in the text. The repository also cannot reproduce the headline: it lacks the OpenAI pipeline, predictions, results, few-shot/format and BERT/RoBERTa code; the paraphrase dataset returns 401, `requirements.txt` is missing, scripts contain broken paths, README swaps Phi/Mistral links, and checkpoints are incomplete. The defensible conclusion is that fine-tuned models can approximate a lead coder on ten known questions in a reduced balanced corpus. The work does not validate the test, generalization to new participants, items, demographic groups, or clinics, or use as a screening tool.

Pregunta de investigación

¿Con qué accuracy y acuerdo con un lead coder pueden varios modelos calificar respuestas abiertas humanas en diez ítems de mind-reading, y cómo cambian los resultados con formato, ejemplos, fine-tuning y paráfrasis sintéticas?

Método

Diez narrativas sociales se administran a 1.733 participantes de 13-30 años. Un lead coder y cuatro codificadores entrenados asignan etiquetas binarias. El artefacto concatena historia, pregunta, rúbrica y respuesta, elimina aleatoriamente ejemplos de la clase global mayoritaria, divide filas individuales con seed 42 y evalúa accuracy macro por ítem. Se prueban prompts GPT-4o/mini, modelos abiertos con LoRA, diez clasificadores por ítem BERT/RoBERTa y paráfrasis GPT-4o añadidas solo a train. La auditoría reproduce el perfil del dataset público, examina split/duplicados/baselines y contrasta código, modelos y disponibilidad.

Muestra: 1.733 participantes de 13-30 años, reclutados en escuelas o Prolific, con diez respuestas potenciales cada uno. No se publican distribución exacta de edad, país, cultura, género, etnia, diagnóstico, site o compensación. El dataset liberado conserva 14.252 respuestas tras undersampling: 11.543 train, 1.283 validation y 1.426 test; omite IDs y demografía.

Hallazgos

  • La fuente autoritativa es CLPsych 2025, DOI 10.18653/v1/2025.clpsych-1.7, páginas 79-89; las 11 páginas se renderizaron e inspeccionaron visualmente.
  • GPT-4o zero-shot obtiene 89,4 % macro; XML 0,84 frente a plain 0,82 y JSON 0,83, y la rúbrica original 0,88 frente a 0,86/0,85.
  • Diez shots apenas cambian GPT-4o 89,4→89,5 y elevan GPT-4o-mini 79,7→81,4; 50 shots reducen ambos a 88,17 y 80,1.
  • Fine-tuned GPT-4o logra 92,8 %; RoBERTa-large 92,0 %, Llama 91,1 %, GPT-4o-mini 90,5 %, BERT/RoBERTa 90,2-92,0 %.
  • La augmentación cambia Longformer 86,7→91,6, Mistral 88,7→91,6, Phi-3.5 83,8→90,1, Llama 91,1→90,5 y Phi-4 87,5→87,6.
  • El artifacto público elimina 3.078 de 17.330 filas por undersampling global y conserva 14.252, exactamente balanceadas por split.
  • La partición real es 80,99 %/9,00 %/10,01 %, no 80/10/10.
  • El pipeline elimina ID de participante antes de dividir respuestas individuales y no implementa group split.
  • Todos los splits contienen las diez mismas historias, preguntas y rúbricas; no hay item-held-out evaluation.
  • Hay tres prompts exactos repetidos train/validation y uno train/test.
  • El baseline mayoritario por ítem en test promedia 62,03 %, pese al balance global 50/50.
  • Table 10 se calcula solo en desacuerdos GPT/humano; su prosa omite que el humano gana el ítem 3 y menciona un ítem 7 ausente.
  • Los scripts dependen de requirements.txt inexistente y una ruta de config inexistente; faltan pipelines y outputs centrales.

Limitaciones

  • La división por respuesta no evita que una persona aparezca en varios splits.
  • Sin IDs públicos no puede medirse ni corregirse el solapamiento de participante.
  • Fine-tuning y test comparten los mismos diez ítems; no se prueba generalización a preguntas nuevas.
  • Cuatro prompts idénticos cruzan splits, incluido uno train/test.
  • El undersampling elimina 17,76 % de respuestas y altera prevalencia y métricas operativas.
  • Accuracy macro no informa sensibilidad, especificidad, calibración, false positives/negatives ni costes clínicos.
  • Los baselines por ítem llegan a 77,70 % y no se comparan en el paper.
  • No hay tests, intervalos, repeticiones, bootstrap por participante/ítem o corrección múltiple para significant.
  • Las decisiones de formato y rúbrica no describen un holdout separado; existe riesgo de selección sobre evaluación.
  • El paper no aclara si los ejemplos few-shot proceden solo de train.
  • Kappa en casos seleccionados por desacuerdo no es fiabilidad global ni comparable con el κ inicial humano.
  • Lead-coder agreement mide fidelidad al referente, no verdad psicológica independiente.
  • Table 10 contradice parcialmente la prosa y solo cubre dos codificadores y nueve combinaciones coder-item.
  • No se evalúan dimensionalidad, consistencia interna, test-retest, validez convergente/discriminante, invariancia o validez clínica.
  • No se publican análisis por edad, site, cultura, género, etnia, idioma o diagnóstico.
  • Las diez narrativas y una muestra 13-30 no sostienen generalización universal.
  • Un solo coder valida 500 paráfrasis con raw agreement >90 %; faltan κ, intervalos y auditoría del resto.
  • GPT-4o genera paráfrasis y también es scorer, posible ventaja de estilo de proveedor.
  • El dataset de paráfrasis no es público actualmente; el base no tiene dataset card ni licencia declarada.
  • El repositorio carece de requirements.txt, outputs y varias implementaciones; README y checkpoints tienen errores.
  • Los model cards públicos son plantillas vacías sin uso previsto, datos, riesgos o límites clínicos.
  • Se publican narrativas auténticas de jóvenes y respuestas desde los 13 años, pero el paper solo indica aprobación ética y no detalla consentimiento de publicación, anonimización, retirada o gobernanza.
  • Los rangos ID de Table 10 llegan a 2.157 aunque se reportan 1.733 participantes; no se explica la numeración.

Qué no demuestra

  • No demuestra que el LLM tenga teoría de la mente o comprenda estados mentales como una persona.
  • No estudia ni demuestra personalidad de LLM.
  • No valida psicométricamente el instrumento de diez ítems.
  • No demuestra generalización a participantes nuevos por la partición sin grupos.
  • No demuestra transferencia a ítems, tests, idiomas o dominios nuevos.
  • No establece superioridad general frente a codificadores humanos con el kappa seleccionado por desacuerdo.
  • No prueba significancia de las diferencias de accuracy ni de los efectos de augmentación.
  • No establece seguridad o utilidad como herramienta clínica, diagnóstica o de cribado.
  • No demuestra equidad entre edades, demografías o condiciones clínicas.
  • No reproduce end-to-end el 92,8 % de GPT-4o desde el artefacto público.

Trazabilidad

Alcance: Texto completo

Versión: Proceedings of CLPsych 2025, Anthology ID 2025.clpsych-1.7, DOI 10.18653/v1/2025.clpsych-1.7, pages 79-89, 11 pages

Fuente consultada: https://aclanthology.org/2025.clpsych-1.7/

Revisión: Codex complete bilingual full-text fidelity pass using the published CLPsych version, all-page visual inspection, official Git history audit, Hugging Face split profiling, exact label and item-baseline analysis, cross-split duplicate inspection, participant-group leakage review, model-repository inventory, reproducibility audit, kappa-table reconciliation, psychometric-validity assessment, ethical-reporting review, and scope-boundary correction; summaries written from the paper and artifact evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • openai/gpt-4o-2024-08-06
  • openai/gpt-4o-mini-2024-07-18
  • allenai/longformer-base-4096
  • Paper label meta/llama-3.2-3B-instruct; released fine-tuned artifact uses NousResearch/Hermes-3-Llama-3.2-3B
  • mistralai/Mistral-7B-Instruct-v0.3
  • microsoft/Phi-3.5-mini-instruct
  • microsoft/phi-4
  • BERT-base and BERT-large, ten item-specific classifiers each
  • RoBERTa-base and RoBERTa-large, ten item-specific classifiers each

Instrumentos y métricas

  • Ten open-response advanced mind-reading social-narrative items
  • Item-specific binary coding manuals
  • Human coding with lead-coder adjudication and initial Cohen's kappa greater than .7
  • Plain, XML, and JSON prompt formats
  • Original, rephrased, and GPT-4o-summarized grading schemes
  • Zero-shot, 10-shot, and 50-shot prompting
  • LoRA and OpenAI fine-tuning
  • GPT-4o training-response paraphrase augmentation
  • Accuracy and selected-subset Cohen's kappa
  • Independent response-split, duplicate, prevalence, and majority-baseline audit

Datos utilizados

  • Reported raw design: 1,733 participants x 10 items = 17,330 response opportunities
  • Hugging Face rshwndsz/ToM-auto-scoring-base commit 6c2334d2854cd1e50b5cb1565524079e780e5fc2: 14,252 balanced derived rows
  • Train 11,543; validation 1,283; test 1,426
  • Hugging Face rshwndsz/ToM-auto-scoring-paraphrased, inaccessible with HTTP 401 on 15 July 2026
  • Public fine-tuned model repositories, several incomplete or mismatched with README labels

Evidencia y localización

  • Abstract, alcance, muestra y preguntas de investigación: Published pages 79-80, Abstract and Introduction
  • Datos, codificación y dificultad por ítem: Published pages 81-82, Section 3.1 and Tables 1-2
  • Modelos, prompts, split declarado, fine-tuning y paráfrasis: Published pages 83-84, Sections 3.2-3.5
  • Resultados zero/few-shot, fine-tuning y augmentación: Published pages 84-86, Tables 4-9
  • Comparación humana, kappa seleccionado y error de prosa: Published pages 85-87, Section 4.4 and Table 10
  • Limitación reconocida y aprobación ética: Published pages 87-88, Sections 7-8
  • Undersampling, row split, pérdida de IDs, split real y ausencia de item holdout: Official repository commits 601612c and 69152da, odysseus/data.py audited 15 July 2026
  • 14.252 filas, balance, baselines por ítem y duplicados cross-split: Hugging Face base dataset commit 6c2334d2854cd1e50b5cb1565524079e780e5fc2 independently profiled 15 July 2026
  • Artifactos inaccesibles, incompletos, rotos o mal enlazados: Official GitHub and ten linked Hugging Face model repositories inventoried 15 July 2026
  • Auditoría integral de validez y reproducción: reports/verification/article-192-psychometric-split-and-artifact-audit.json
  • Inspección visual completa: All 11 published PDF pages rendered and visually inspected on 15 July 2026