LMLPA: Language Model Linguistic Personality Assessment

Evaluación y validez psicométrica2024ACL AnthologyRevisión editorial aprobada

Autores: Jingyao Zheng, Xian Wang, Simo Hosio, Xiaoxian Xu, Lik-Hang Lee

Palabras clave: Computation and Language, Artificial Intelligence, Personality Assessment, Computational Linguistics

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
16
Hallazgos
34
Limitaciones
15
Evidencias

Resumen editorial

Español

LMLPA propone sustituir la administración directa del Big Five Inventory a un LLM por un cuestionario adaptado a capacidades lingüísticas. Convierte los 44 ítems BFI en preguntas abiertas del tipo «¿hasta qué punto…?», obliga al modelo a incluir siempre, often, sometimes, rarely o never y una justificación de una frase, y encarga a otro modelo transformar el texto en una puntuación 1–5. Cinco profesionales de psicología revisaron cualitativamente las adaptaciones; después, PCA elimina cuatro ítems y deja una versión final de 40. La aportación más útil es publicar íntegramente preguntas, prompts, etiquetas y análisis de sensibilidad al orden, reconociendo además que los LLM no poseen acciones, emociones o procesos cognitivos humanos y que su output se usa como proxy lingüístico.

En las pruebas de orden, GPT-4-Turbo responde los 44 ítems en llamadas separadas y a temperatura 0. Al invertir la lista de adverbios obligatorios, siete pares se consideran realmente discordantes después de corregir manualmente un caso semánticamente equivalente, con kappa ponderado 0,730. En la comparación posterior, el BFI numérico produce 16 discrepancias y kappa 0,401, mientras el sistema completo LMLPA produce seis y kappa 0,877. Esto demuestra mayor estabilidad de outputs bajo esas dos configuraciones, pero no aísla el efecto del cuestionario abierto: en BFI se invierte la escala que ve el modelo evaluado; en LMLPA se invierte la escala que ve GPT-4-Turbo como juez. La lista ordenada de cinco adverbios sigue dentro del prompt del test-taker y la lista de cinco etiquetas se desplaza al rater, por lo que no desaparece la estructura de opción; cambia de etapa.

Tres de los expertos puntúan un único conjunto de 44 respuestas de GPT-4-Turbo. Las correlaciones del rater GPT-4-Turbo con ellos son 0,827–0,877 y su ICC de medida individual es 0,829; BART-Large-MNLI obtiene 0,700–0,810 e ICC 0,766 y Llama3-8B 0,750–0,840 e ICC 0,785. Es evidencia de acuerdo para respuestas muy estructuradas que contienen un adverbio de frecuencia obligatorio, no de exactitud del rasgo. El tipo exacto de ICC y su supuesto de acuerdo/consistencia no se especifican; el ICC «average measures» combina cuatro ratings y no representa el rendimiento de un juez individual. Llama3 muestra además kappa 0,279 cuando se invierten sus opciones, por lo que se excluye de la fase psicométrica precisa.

La consistencia y la estructura se estiman con 250 condiciones generadas por el mismo GPT-4-Turbo: diez descripciones PersonaChat combinadas con 25 perfiles que escriben explícitamente cinco niveles de cada rasgo en el system prompt. Los alfas sobre los 44 ítems son 0,869–0,936, pero pueden reflejar redundancia de ítems, obediencia al prompt, método y juez comunes; no se recalculan tras eliminar Q31, Q35, Q41 y Q22 para formar la escala final de 40. La PCA obtiene KMO 0,951 y cuatro componentes, no cinco; Conscientiousness se reparte entre varios, hay numerosas cargas cruzadas y el texto llega a atribuir Neuroticism al componente 3 aunque la tabla lo concentra en el 2. La misma muestra se usa para eliminar ítems y declarar validez, sin CFA o réplica independiente.

La prueba final vuelve a tratar como «ground truth» los adjetivos Big Five insertados directamente en el prompt de GPT-4-Turbo, Llama3-8B-Instruct y Mistral-7B-Instruct-v0.2. Las distribuciones suelen moverse en la dirección pedida, pero no coinciden con los niveles, baja agradabilidad se concentra en 2–3 y el neuroticismo de Llama3 se mueve en dirección contraria en el extremo; no se publica una métrica de error, correlación o clasificación. Cuando GPT-4-Turbo genera y juzga, existe circularidad de modelo y conocimiento compartido del instrumento. Sin snapshots precisos del servicio, semillas, repeticiones, outputs, datos o código público, el protocolo no es reproducible íntegramente. En consecuencia, LMLPA es un instrumento abierto y prometedor para describir autodeclaraciones lingüísticas condicionadas por prompts, pero sus datos no prueban una personalidad latente, estable, predictiva o equivalente al Big Five humano.

English

LMLPA proposes replacing direct administration of the Big Five Inventory to an LLM with a questionnaire adapted to linguistic capabilities. It converts the 44 BFI items into open-ended “to what extent” questions, requires the model to include always, often, sometimes, rarely, or never plus a one-sentence rationale, and asks another model to turn the text into a 1–5 score. Five psychology professionals qualitatively reviewed the adaptations; PCA then removes four items, leaving a final 40-item version. Its clearest contribution is the complete publication of questions, prompts, labels, and order-sensitivity analyses, while explicitly acknowledging that LLMs do not have human actions, emotions, or cognitive processes and that output is used as a linguistic proxy.

In the order tests, GPT-4-Turbo answers all 44 items in separate calls at temperature 0. Reversing the required adverb list yields seven pairs considered truly inconsistent after one semantically equivalent case is manually corrected, with weighted kappa 0.730. In the later comparison, numeric BFI produces 16 discrepancies and kappa 0.401, whereas the full LMLPA system produces six and kappa 0.877. This demonstrates greater output stability under those two configurations, but it does not isolate the effect of an open questionnaire: the BFI condition reverses the scale shown to the test-taking model, while LMLPA reverses the scale shown to GPT-4-Turbo as judge. An ordered list of five adverbs remains in the test-taker prompt, and a list of five labels is shifted to the rater, so option structure is moved to another stage rather than removed.

Three of the experts rate one set of 44 GPT-4-Turbo responses. GPT-4-Turbo as rater correlates 0.827–0.877 with them and has a single-measure ICC of 0.829; BART-Large-MNLI reaches 0.700–0.810 and ICC 0.766, and Llama3-8B reaches 0.750–0.840 and ICC 0.785. This is evidence of agreement on highly structured responses containing a mandatory frequency adverb, not evidence that the inferred trait is correct. The exact ICC model and whether it targets agreement or consistency are not specified; the “average measures” ICC combines four ratings and is not the performance of one automated judge. Llama3 also obtains kappa 0.279 when its rating options are reversed, so it is excluded from the precise psychometric phase.

Reliability and structure are estimated from 250 conditions generated by the same GPT-4-Turbo: ten PersonaChat descriptions crossed with 25 profiles that explicitly place five levels of each trait in the system prompt. Alpha values on the 44 items are 0.869–0.936, but can reflect item redundancy, prompt compliance, and shared test-taker/rater method; they are not recomputed after Q31, Q35, Q41, and Q22 are removed to form the final 40-item scale. PCA reports KMO 0.951 and extracts four components rather than five; Conscientiousness is distributed across several components, cross-loadings are extensive, and the prose assigns Neuroticism to component 3 even though the table concentrates it in component 2. The same sample is used for item deletion and the validity claim, with no CFA or independent replication.

The final test again treats Big Five adjectives written directly into prompts for GPT-4-Turbo, Llama3-8B-Instruct, and Mistral-7B-Instruct-v0.2 as “ground truth.” Score distributions usually shift in the requested direction but do not match target levels; low Agreeableness clusters at 2–3, and Llama3 Neuroticism moves in the opposite direction at the extreme. No error, correlation, or classification metric is reported. When GPT-4-Turbo both generates and judges outputs, model circularity and shared instrument knowledge remain. Without exact service snapshots, seeds, repetitions, outputs, data, or public code, the full protocol is not reproducible. LMLPA is therefore a promising open instrument for describing prompt-conditioned linguistic self-reports, but its evidence does not establish a latent, stable, predictive, or human-equivalent Big Five personality.

Pregunta de investigación

¿Puede un BFI adaptado a propiedades lingüísticas, respondido mediante texto abierto y puntuado por un agente de IA, medir de forma más estable y psicométricamente defendible la «personalidad lingüística» expresada por LLM que la administración directa de escalas humanas?

Método

Desarrollo y evaluación de instrumento en varias fases. Reformula los 44 ítems BFI para preguntar por conductas lingüísticas del modelo y añade una instrucción que exige un adverbio de frecuencia y una justificación. Cinco profesionales de psicología participan en entrevistas de una hora para revisar contenido. GPT-4-Turbo responde y se somete a inversiones de orden; BART-Large-MNLI, GPT-4-Turbo y Llama3-8B-Instruct puntúan 44 respuestas y se comparan con tres expertos mediante correlaciones e ICC. Para alfa y PCA, GPT-4-Turbo genera respuestas bajo 250 combinaciones de diez descripciones de persona y 25 perfiles Big Five; PCA con Varimax elimina cuatro ítems. Finalmente, GPT-4-Turbo, Llama3-8B-Instruct y Mistral-7B-Instruct-v0.2 reciben cinco niveles de cada rasgo y son evaluados por GPT-4-Turbo y Llama3. La revisión editorial leyó y renderizó las 42 páginas, examinó tablas, figuras, los 44 ítems originales, los 40 finales, prompts y anexos, y buscó materiales públicos asociados.

Muestra: La participación humana comprende cinco profesionales de psicología con 3,5–11 años de experiencia; tres con familiaridad Big Five autopuntuada 5 vuelven a evaluar 44 respuestas. No se informan edad, género, criterios de exclusión o análisis sistemático de las entrevistas. La muestra psicométrica no son 250 LLM independientes: son 250 condiciones del mismo GPT-4-Turbo creadas con diez textos PersonaChat y 25 instrucciones de rasgo. En la prueba final, tres modelos reciben cinco niveles por cada uno de los cinco rasgos, cada nivel combinado con diez descripciones; los anexos muestran conjuntos de persona distintos para GPT-4-Turbo, Llama3 y Mistral. Las llamadas se hacen a temperatura 0, pero no se publican snapshots exactos de GPT-4-Turbo, semillas, repetición temporal o número total inequívoco de outputs y llamadas.

Hallazgos

  • La inversión del orden de adverbios en las respuestas abiertas de GPT-4-Turbo produce siete discordancias reales de 44 tras corregir manualmente un caso semánticamente equivalente; kappa ponderado 0,730, IC 95% 0,554–0,905.
  • En la comparación del sistema completo, el BFI directo presenta 16 discrepancias y kappa 0,401, IC 0,175–0,626, frente a seis y kappa 0,877, IC 0,777–0,977, para LMLPA.
  • La mayor estabilidad no elimina opciones ordenadas: el modelo evaluado recibe cinco adverbios en el prompt y el juez recibe cinco etiquetas numeradas.
  • Las respuestas antes y después de invertir adverbios tienen mediana de similitud semántica superior a 0,96, aunque MiniLM también puede puntuar alto paráfrasis que cambian la frecuencia o polaridad relevante.
  • GPT-4-Turbo como juez correlaciona 0,851, 0,877 y 0,827 con los tres humanos; Llama3 0,80, 0,84 y 0,75; BART 0,74, 0,81 y 0,70.
  • Los ICC de medida individual son 0,829 para GPT-4-Turbo, 0,785 para Llama3 y 0,766 para BART; los ICC de medida media son 0,951, 0,936 y 0,929, respectivamente.
  • Llama3 obtiene kappa 0,279, IC 0,109–0,449, al invertir la escala del rater, por lo que los autores lo excluyen de alfa y PCA.
  • Los alfas sobre la versión de 44 ítems son 0,869 en extraversión, 0,899 en agradabilidad, 0,924 en consciencia, 0,886 en neuroticismo y 0,936 en apertura.
  • Q31, Q35 y Q41 no cargan al menos 0,40 y se eliminan durante dos iteraciones; Q22 se elimina después por cargar menos de 0,40 en el componente de agradabilidad, dejando 40 ítems.
  • El alfa no se vuelve a calcular para la escala final de 40 ítems, pese a que Q35 y Q41 aparecen como elementos cuya eliminación aumentaría el alfa de apertura.
  • KMO se reporta como 0,951 y la PCA retiene cuatro componentes, no los cinco rasgos esperados.
  • Apertura y extraversión forman grupos relativamente claros; agradabilidad se concentra principalmente en el componente 3, neuroticismo en el 2 y consciencia se reparte entre componentes 1, 2 y 3.
  • El texto afirma por error que neuroticismo carga predominantemente en el componente 3, mientras la Tabla 4 muestra cargas fuertes y negativas en el componente 2.
  • En la prueba de manipulación, los scores suelen desplazarse en la dirección de los adjetivos del prompt, pero los niveles observados no coinciden con el target y no se ofrece una métrica agregada de fidelidad.
  • Los tres modelos evitan la agradabilidad extremadamente baja; el neuroticismo de Llama3 disminuye hacia aproximadamente 2 cuando el prompt target llega a 5.
  • Los resultados son más concentrados cuando GPT-4-Turbo actúa también como test-taker o rater, patrón compatible tanto con mejor juicio como con circularidad de familia/modelo.

Limitaciones

  • Las preguntas siguen solicitando autodescripciones del propio modelo, «¿hasta qué punto haces X?», por lo que reemplazan self-report de emociones por self-report de capacidades y estilo, no por conducta observada independientemente.
  • Los ítems exigen uno de cinco adverbios ordenados. El formato no es plenamente abierto y puede mapearse casi directamente a la escala 1–5.
  • El juez conoce de antemano el rasgo que debe puntuar y recibe etiquetas explícitas, lo que favorece el reconocimiento semántico y reduce la independencia del criterio.
  • Varias preguntas confunden rasgos con calidad, seguridad o capacidad: factualidad y coherencia se asignan a consciencia/neuroticismo, rechazo de lenguaje dañino a agradabilidad, y conocimiento artístico a apertura.
  • Algunos ítems requieren introspección que el modelo no posee, como saber si usa su dataset eficientemente o expande respuestas más allá de sus datos de entrenamiento.
  • Las entrevistas de cinco expertos son cualitativas; no se publica índice de validez de contenido, ratings ciegos por ítem, protocolo de análisis, transcripciones o acuerdo sobre las modificaciones.
  • Dos expertos autoevalúan su familiaridad Big Five como 2 y 3. La experiencia ayuda al diseño, pero no convierte por sí sola las adaptaciones en medidas válidas del constructo.
  • La compensación declarada es HK$13,30 por una entrevista de aproximadamente una hora; el artículo no explica esa cifra inusualmente baja.
  • Los tres humanos puntúan un único conjunto de 44 respuestas de GPT-4-Turbo, demasiado estrecho para validar jueces en modelos, prompts, dominios y estilos diversos.
  • Las respuestas contienen obligatoriamente always/often/sometimes/rarely/never; humanos y modelos pueden lograr alto acuerdo leyendo esa señal superficial sin evaluar el razonamiento o el constructo.
  • Las correlaciones denominadas inter-item son correlaciones entre vectores de rater. No se informan intervalos, robustez ordinal, ponderación ni ajuste por múltiples correlaciones.
  • El modelo exacto de ICC, selección entre acuerdo absoluto y consistencia, efectos fijos/aleatorios y unidad de generalización no se especifican, limitando su interpretación y reproducción.
  • El ICC de average measures es la fiabilidad de una media de cuatro ratings, no evidencia de que el AI rater individual alcance ese valor.
  • La comparación BFI–LMLPA invierte escalas en etapas distintas y usa instrumentos diferentes; no atribuye causalmente la diferencia de kappa al carácter abierto del cuestionario.
  • El caso Q35 se recodifica manualmente después de observar que never y always expresan el mismo significado con polaridad de frase opuesta; no se publica una regla previa para correcciones similares.
  • Kappa p<0,001 contrasta principalmente acuerdo superior a cero; no demuestra imparcialidad, validez o equivalencia entre escalas. Tampoco se contrasta formalmente la diferencia 0,401 frente a 0,877.
  • Temperatura 0 no garantiza determinismo exacto de servicios alojados, y no se realizan replicaciones, test-retest entre fechas o análisis de cambios de snapshot.
  • Las 250 filas proceden de un único GPT-4-Turbo y de prompts construidos para producir covariance Big Five; llamarlas «distinct GPT-4-Turbos» sobrestima independencia y diversidad.
  • Los perfiles escriben directamente los adjetivos del rasgo en el system prompt, por lo que alfa alto y estructura factorial pueden reflejar obediencia común al prompt y no una escala válida.
  • Un único GPT-4-Turbo genera respuestas y las puntúa en la fase psicométrica, introduciendo método común, autoconsistencia de modelo, contaminación por conocimiento del BFI y circularidad.
  • Cronbach alpha elevado no prueba unidimensionalidad, estabilidad temporal, equivalencia de medida o validez; también aumenta con redundancia semántica entre ítems.
  • Los alfas pertenecen a los 44 ítems previos a la depuración; no se documenta la fiabilidad de la versión final de 40 que se propone usar.
  • La PCA se utiliza como análisis factorial, emplea Varimax ortogonal pese a que los rasgos/cargas se solapan y selecciona factores con Kaiser más scree sin reportar varianza explicada o análisis paralelo.
  • KMO se acompaña de p<0,001 aunque KMO no tiene ese contraste; no se reportan estadístico y grados de libertad de Bartlett, por lo que la atribución del p es ambigua.
  • La estructura no recupera cinco dimensiones, consciencia carece de componente propio y hay numerosas cargas cruzadas. Interpretar cuatro componentes como confirmación Big Five es más fuerte que los datos.
  • Se eliminan ítems y se declara validez usando la misma muestra; no hay CFA, holdout, réplica en otro modelo o comparación con estructuras alternativas.
  • El texto contiene una inconsistencia material al asignar neuroticismo al componente 3 cuando la tabla lo sitúa en el 2.
  • La prueba final define como ground truth una instrucción de prompt; eso valida sensibilidad a palabras del prompt, no personalidad latente ni comportamiento estable.
  • No se publican MAE, correlación target–score, exactitud ordinal, intervalos o pruebas de tendencia para Figura 6; algunas condiciones fallan visiblemente y aun así se afirma evaluación precisa.
  • Las diez personas se asumen inocuas sin probarlo y son distintas para cada modelo, lo que confunde comparación de GPT-4-Turbo, Llama3 y Mistral.
  • No se evalúan prompts neutrales, adversariales o parafraseados que oculten las etiquetas del rasgo, ni generalización a conversación real longitudinal.
  • El artículo no fija un snapshot preciso de GPT-4-Turbo, semillas, hardware/configuración completa de los modelos abiertos, fechas de llamadas o número de repeticiones.
  • No se identificó repositorio oficial con código, outputs, ratings, datos intermedios o scripts; los apéndices permiten reimplementar parcialmente, no reproducir exactamente resultados.
  • No se examinan sesgos culturales o demográficos, invariancia, seguridad de inferencia, consecuencias de etiquetar sistemas o humanos, ni validez predictiva respecto a outcomes de interacción.

Qué no demuestra

  • No demuestra que GPT-4-Turbo, Llama3 o Mistral posean una personalidad psicológica interna, consciente o equivalente a la humana.
  • No demuestra que los scores sean rasgos estables entre prompts, usuarios, tareas, idiomas, fechas o versiones del modelo.
  • No demuestra que responder con always u often describa el comportamiento real del modelo en interacciones no guiadas.
  • No demuestra que el juez GPT-4-Turbo sea objetivo o independiente; muestra acuerdo con tres expertos sobre 44 respuestas muy estructuradas.
  • No demuestra que la mejora de kappa proceda exclusivamente del formato abierto, porque se comparan etapas e instrumentos distintos.
  • No demuestra validez Big Five de la versión final de 40 ítems; el alfa corresponde a 44 y la PCA recupera cuatro componentes.
  • No demuestra validez convergente, discriminante, criterial, predictiva, ecológica o invariancia de medida.
  • No demuestra que los adjetivos del prompt sean ground truth de personalidad; son condiciones de instrucción conocidas por sistemas entrenados para seguir lenguaje natural.
  • No demuestra medición precisa de los cinco niveles: los scores no coinciden exactamente, hay compresión de extremos y fallos de dirección.
  • No permite concluir que diferencias entre modelos sean arquitectónicas o de safeguards, porque personas, jueces y snapshots no están controlados de forma equivalente.
  • No valida usos en educación, marketing, fabricación, recomendación, selección, diagnóstico o decisiones de alto impacto.
  • No permite reproducir completamente cifras y figuras sin outputs, código, configuración y artefactos de análisis.
  • No establece un benchmark comparativo de modelos base en condiciones neutrales; principalmente valida respuesta a perfiles Big Five explícitos.
  • No prueba que cuatro componentes sean una teoría alternativa de personalidad lingüística; es una solución exploratoria de una muestra inducida.

Trazabilidad

Alcance: Texto completo

Versión: Computational Linguistics 51(2), June 2025, pp. 599–640, DOI 10.1162/coli_a_00550; final 42-page journal version with all appendices

Fuente consultada: https://aclanthology.org/2025.cl-2.6.pdf

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI GPT-4-Turbo as test taker and AI rater
  • Meta-Llama-3-8B-Instruct as test taker and AI rater
  • Mistral-7B-Instruct-v0.2 as test taker
  • facebook/bart-large-mnli as zero-shot NLI rater
  • sentence-transformers/all-MiniLM-L6-v2 for response similarity

Instrumentos y métricas

  • Original 44-item Big Five Inventory
  • 44-item Adapted-BFI open-ended draft
  • Final 40-item LMLPA questionnaire after PCA
  • Five mandatory frequency adverbs: always, often, sometimes, rarely, never
  • GPT rater 1–5 Big Five label prompt
  • BART-Large-MNLI entailment-based zero-shot classifier
  • Weighted Cohen kappa
  • Sentence embedding cosine similarity
  • Pairwise rater correlation
  • Intraclass correlation coefficient
  • Cronbach alpha
  • Kaiser-Meyer-Olkin measure
  • Bartlett test of sphericity
  • Principal component analysis with Varimax rotation

Datos utilizados

  • One 44-response GPT-4-Turbo set for order and rater-agreement experiments
  • Five psychology expert interviews
  • Three expert ratings of the same 44 GPT-4-Turbo responses
  • 250 GPT-4-Turbo prompt conditions: 10 PersonaChat descriptions × 25 Big Five profiles
  • PersonaChat persona descriptions from Zhang et al. (2018)
  • Five prompted levels per trait and 10 persona descriptions per test-taker model in the final measurement test
  • Complete questionnaire, prompts, labels, persona descriptions and loadings published in the article appendices
  • No public raw outputs, analysis code or machine-readable result dataset identified

Evidencia y localización

  • Publicación final, DOI, alcance y reconocimiento de diferencias humano–LLM: Computational Linguistics 51(2), pp. 599–602, abstract and section 1
  • Adaptación del BFI y revisión por cinco expertos: Published article, sections 3.1.1–3.1.2 and Table 2, pp. 605–608
  • Adverbios obligatorios, justificación y primer experimento de inversión: Published article, sections 3.1.3–3.2 and Figure 2, pp. 608–610
  • BART, GPT-4-Turbo, Llama3 y comparación con tres humanos: Published article, sections 4.1–4.2 and Figure 3, pp. 611–614
  • ICCs, kappa de Llama3 y selección de GPT-4-Turbo como juez psicométrico: Published article, section 4.2.2 and opening of section 5, pp. 613–614
  • BFI frente a LMLPA bajo inversión de escala: Published article, section 5.1 and Figure 4, pp. 615–616
  • 250 condiciones GPT-4-Turbo construidas con diez personas y 25 perfiles: Published article, section 5.2, p. 617; Appendix E, pp. 631–633
  • Alfas sobre 44 ítems: Published article, section 5.2.1 and Table 3, pp. 617–618
  • KMO, PCA, cuatro componentes, eliminaciones y cargas cruzadas: Published article, section 5.2.2, Figure 5 and Table 4, pp. 618–621
  • Error textual en la asignación de neuroticismo: Published article, p. 621 says Neuroticism loads predominantly on Component 3; Table 4, p. 620, places its strongest loadings on Component 2
  • Prueba con prompts tratados como ground truth y resultados cualitativos: Published article, section 5.3 and Figure 6, pp. 622–623
  • Alcance como proxy lingüístico, limitaciones declaradas y conclusión: Published article, sections 6–7, pp. 624–627
  • Preguntas, prompts, escalas y versión final de 40 ítems: Published article, Appendices A–F, pp. 627–635
  • Año, volumen, páginas, DOI y licencia de la versión definitiva: ACL Anthology 2025.cl-2.6 and journal title page, verified 15 Jul 2026
  • Ausencia de artefacto reproducible identificado: Published article contains model links but no code/data repository or data availability statement; author, ACL, arXiv and GitHub searches on 15 Jul 2026 found no official artifact