Benchmarking Personality Inference in Large Language Models Using Real-World Conversations

Evaluación y validez psicométrica2025DOIRevisión editorial aprobada

Autores: Jianfeng Zhu, Xinyu Li, Julina Maharjan, Karin G. Coifman, Ruoming Jin

Palabras clave: Large Language Models, Personality Inference, Benchmarking, Big Five Inventory, Zero-Shot Prompting, Chain-of-Thought Prompting

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
30
Hallazgos
65
Limitaciones
16
Evidencias

Resumen editorial

Español

El artículo publicado evalúa si cuatro LLM pueden inferir puntuaciones BFI-10 y rasgos Big Five a partir de entrevistas semiestructuradas. La revisión usa el artículo definitivo de 25 páginas, su suplemento oficial de 6 páginas y conserva la prepublicación arXiv v1 solo como antecedente. La versión de revista amplía el estudio original: añade GPT-5-Mini, incorpora a Xinyu Li y Julina Maharjan a la autoría, reorganiza los autores y publica resultados suplementarios con intervalos de confianza. No hay código ni datos de participantes disponibles.

El conjunto parte de 555 adultos de Estados Unidos reclutados en varios estudios sobre adaptación a acontecimientos adversos o de transición; 518 con BFI-10 completo y válido entran en los análisis. Las conversaciones no son diálogos cotidianos espontáneos: son entrevistas de investigación guionizadas sobre actividades diarias, una dificultad personal, regulación emocional y acontecimientos positivos y negativos recientes. El texto se pasa a minúsculas, se elimina puntuación y stopwords en inglés, y se truncan repeticiones o muletillas mediante un procedimiento no especificado. Ese preprocesamiento elimina precisamente parte de las señales de estilo, función gramatical, negación y dinámica conversacional que podrían ser pertinentes para personalidad, y no se compara con el texto sin procesar.

GPT-4.1-Mini, GPT-5-Mini, Meta-LLaMA-3.3-70B-Instruct-Turbo y DeepSeek-R1-Distill-70B predicen diez ítems BFI con prompt directo y cinco rasgos mediante prompt directo o chain-of-thought. El referente es el autoinforme BFI-10 de la misma sesión, no una observación objetiva de la personalidad. En los 518 casos analizados, la relación con el referente es débil: las correlaciones por ítem van de −0,18 a 0,27 y las de rasgo permanecen por debajo de 0,30. El mejor resultado de rasgo es Conscientiousness con GPT-4.1-Mini en zero-shot, r=0,25 (IC95% 0,167–0,329). Muchos intervalos incluyen cero, y algunos efectos significativos son negativos. Los errores MAE/RMSE suelen superar un punto en la escala 1–5 salvo varias condiciones de Openness. Los modelos desplazan las predicciones hacia valores moderados o altos y casi no concuerdan por categorías con el autoinforme: κ va aproximadamente de −0,07 a 0,11.

Las tasas “off-by-one” de 0,57 a 1,00 no contradicen ese fracaso. Con solo tres categorías ordenadas, una predicción Moderate está a como máximo una categoría tanto de Low como de High; la métrica solo penaliza el salto entre extremos. Meta-LLaMA con CoT logra 1,00 en tres rasgos al concentrar predicciones en el centro, mientras κ sigue cerca de cero. Por eso el resumen no interpreta off-by-one como precisión clínica o psicométrica. Tampoco hay comparación con un predictor de la media, humanos que lean las mismas entrevistas, modelos estadísticos sencillos o baselines demográficos; MAE bajo puede reflejar regresión al centro sin inferencia individual válida.

La repetibilidad se estudia únicamente con GPT-4.1-Mini, 50 participantes y tres ejecuciones, y además se aleatoriza el orden de segmentos: no justifica decir que los cuatro modelos tienen alta estabilidad ni equivale a validez. El tipo exacto de ICC de esta prueba no se declara en la versión publicada y el suplemento solo lista los coeficientes. La concordancia entre modelos excluye GPT-5-Mini y es baja por ítem (ICC 0,02–0,26); a nivel de rasgo es 0,54–0,76 en zero-shot y cae a 0,11–0,34 con CoT. El análisis de longitud usa los primeros 100, los primeros 1.000 y el texto completo, por lo que confunde longitud con posición y contenido de las preguntas; además, el método dice “palabras” y resultados dice “tokens”. El contexto medio maximiza las correlaciones observadas, mientras el contexto largo aumenta varios RMSE.

El trabajo documenta con utilidad una limitación real de los LLM actuales, pero no aísla su causa ni valida un sistema de evaluación de personalidad. El BFI-10 tiene solo dos ítems por rasgo; no se informa su fiabilidad en esta muestra, el algoritmo de agregación/reverse scoring, la corrección por comparaciones múltiples ni tests directos entre modelos o prompts. La limpieza, exclusiones, modelos/API, fechas, parsing de respuestas y prueba χ² de longitud no están suficientemente especificados para reproducir los resultados. Las explicaciones CoT se muestran como ejemplos pero no se evalúa su fidelidad, por lo que no son evidencia interpretable. La conclusión defendible es estrecha: bajo estas entrevistas, prompts, modelos y autoinforme breve, las predicciones son repetibles en una prueba limitada pero tienen poca alineación individual y mala concordancia categórica. No demuestra inferencia fiable de personalidad, superioridad sobre baselines, generalización a conversaciones cotidianas ni aptitud para decisiones sobre personas.

English

The published article evaluates whether four LLMs can infer BFI-10 item scores and Big Five traits from semi-structured interviews. This review uses the definitive 25-page article and its official six-page supplement, retaining arXiv v1 only as a superseded source. The journal version materially expands the preprint: it adds GPT-5-Mini, adds Xinyu Li and Julina Maharjan to the author list, reorders the authors, and reports supplementary confidence intervals. Neither code nor participant data are available.

The dataset starts with 555 U.S. adults recruited across several studies of adjustment to adverse or transitional life events; 518 participants with complete and valid BFI-10 data enter the analyses. The conversations are not spontaneous everyday dialogue: they are scripted research interviews about daily activities, a personal challenge, emotion regulation, and recent positive and negative events. Text is lowercased, punctuation and English stopwords are removed, and repetitions or fillers are truncated by an unspecified procedure. This preprocessing removes some stylistic, function-word, negation, and conversational-dynamics signals that could matter for personality, and no raw-text ablation is reported.

GPT-4.1-Mini, GPT-5-Mini, Meta-LLaMA-3.3-70B-Instruct-Turbo, and DeepSeek-R1-Distill-70B predict ten BFI items with direct prompting and five traits with direct or chain-of-thought prompting. The reference is same-session BFI-10 self-report, not objective personality ground truth. In the 518 analyzed cases, alignment is weak: item correlations range from −0.18 to 0.27 and all trait correlations remain below 0.30. The best trait result is Conscientiousness for zero-shot GPT-4.1-Mini, r=0.25 (95% CI 0.167–0.329). Many intervals include zero, and some statistically non-zero effects are negative. MAE/RMSE often exceed one scale point on the 1–5 scale except in several Openness conditions. Models shift predictions toward moderate or high values and categorical agreement with self-report is minimal, with κ approximately −0.07 to 0.11.

Off-by-one rates from 0.57 to 1.00 do not contradict that failure. With only three ordered categories, a Moderate prediction is at most one category away from both Low and High; the metric penalizes only a jump between the extremes. Meta-LLaMA with CoT reaches 1.00 on three traits by concentrating predictions centrally while κ remains near zero. This review therefore does not present off-by-one as clinical or psychometric accuracy. There is also no mean-prediction baseline, human-reader baseline, simple statistical model, or demographic baseline; low MAE can result from regression to the center without valid individual inference.

Repeatability is tested only for GPT-4.1-Mini, on 50 participants and three runs, while input-segment order is randomized. It cannot support a claim that all four models are stable and it is not validity. The published version does not identify the exact within-model ICC specification; the supplement merely lists coefficients. Inter-model agreement excludes GPT-5-Mini and is low at item level (ICC 0.02–0.26); at trait level it is 0.54–0.76 under zero-shot and falls to 0.11–0.34 under CoT. The length ablation compares the first 100, first 1,000, and full transcript, confounding length with question order and content; methods call the units words while results call them tokens. Medium context produces the highest observed correlations, while full context increases several RMSE values.

The study usefully documents a limitation of current LLMs, but it does not isolate its cause or validate a personality-assessment system. BFI-10 has only two items per trait; the paper does not report reliability in this sample, the exact aggregation/reverse-scoring algorithm, multiplicity correction, or direct statistical comparisons between models or prompts. Cleaning, exclusions, model/API versions, dates, output parsing, and the length χ² test are insufficiently specified for reproduction. CoT rationales are shown as examples but their faithfulness is not evaluated, so they are not validated interpretability evidence. The defensible conclusion is narrow: under these interviews, prompts, models, and brief self-report reference, predictions show limited repeatability evidence but weak individual alignment and poor categorical agreement. The paper does not establish reliable personality inference, superiority to baselines, generalization to everyday conversations, or fitness for decisions about people.

Pregunta de investigación

¿Hasta qué punto cuatro LLM contemporáneos pueden producir puntuaciones BFI-10 y Big Five alineadas con autoinformes a partir de entrevistas semiestructuradas, y cómo cambian sus resultados con prompting directo o CoT, repeticiones, modelo y longitud de entrada?

Método

Benchmark observacional retrospectivo. Se preprocesan transcripciones de entrevistas guionizadas de varios estudios y se conservan 518 de 555 participantes con BFI-10 completo. Cuatro LLM predicen ítems BFI-10 mediante zero-shot y rasgos Big Five mediante zero-shot y CoT. Se calculan Pearson con IC95%, Spearman, MAE, RMSE, exact match, off-by-one y kappa. GPT-4.1-Mini se repite tres veces en 50 participantes con el orden de segmentos aleatorizado. La concordancia intermodelo usa solo GPT-4.1-Mini, Meta-LLaMA y DeepSeek. Una ablación con GPT-4.1-Mini compara el inicio de 100, 1.000 y todas las palabras/transcripción.

Muestra: La base inicial incluye 555 adultos de Estados Unidos de varios estudios conductuales. Se informan 275 hombres, 278 mujeres y dos casos sin sexo; edad media 39,4 años (DE 16,33); 431 participantes White y 122 non-White/Other, dejando dos valores raciales sin aclarar. Solo 518 con BFI-10 completo y válido se analizan; no se describe el patrón ni el criterio exacto de las 37 exclusiones. La muestra procede de contextos de estrés ocupacional, salud y transiciones vitales, no de una muestra poblacional representativa.

Hallazgos

  • La fuente definitiva es el artículo abierto publicado el 31 de diciembre de 2025, no la prepublicación arXiv de julio.
  • La versión de revista añade GPT-5-Mini, dos autores y un suplemento con intervalos de confianza.
  • El benchmark se presenta con 555 entrevistas, pero todos los resultados analíticos usan 518 participantes.
  • Las entrevistas son semiestructuradas, guionizadas y centradas en experiencias recientes; no son conversaciones cotidianas espontáneas.
  • El referente es autoinforme BFI-10 de la misma sesión y no debe llamarse ground truth objetiva o perfil verdadero.
  • Las correlaciones por ítem abarcan aproximadamente −0,18 a 0,27.
  • GPT-4.1-Mini obtiene el máximo por ítem en BFI-3, r=0,272, con IC95% 0,190–0,350.
  • El mejor resultado por rasgo es GPT-4.1-Mini zero-shot en Conscientiousness, r=0,250, IC95% 0,167–0,329.
  • Ninguna correlación de rasgo alcanza 0,30 y muchas condiciones tienen intervalos que incluyen cero.
  • Hay correlaciones negativas estadísticamente distintas de cero, por ejemplo Meta-LLaMA zero-shot en Extraversion y GPT-5-Mini zero-shot en Extraversion.
  • MAE y RMSE suelen superar un punto de la escala 1–5; Openness presenta errores menores por su distribución y centralidad.
  • Los modelos subrepresentan valores bajos y desplazan muchas predicciones hacia categorías moderadas o altas.
  • La concordancia categórica es casi nula: kappa se sitúa aproximadamente entre −0,07 y 0,11.
  • Off-by-one llega a 1,00 en tres rasgos para Meta-LLaMA CoT sin que kappa deje de ser casi cero.
  • En una escala de tres categorías, off-by-one solo penaliza confundir Low con High y premia automáticamente cualquier Moderate frente a cualquier referente.
  • La repetibilidad publicada corresponde únicamente a GPT-4.1-Mini, 50 participantes y tres ejecuciones.
  • Los coeficientes de repetibilidad de GPT-4.1-Mini van de 0,61 a 0,93 por ítem y de 0,81 a 1,00 por rasgo.
  • El orden de segmentos cambia entre repeticiones, por lo que la prueba mezcla estocasticidad con sensibilidad al orden.
  • La concordancia intermodelo por ítem es baja, ICC(2,1)=0,02–0,26.
  • La concordancia intermodelo por rasgo es 0,54–0,76 en zero-shot y 0,11–0,34 en CoT.
  • GPT-5-Mini se excluye de los ICC intermodelo aunque forma parte del benchmark de cuatro modelos.
  • El contexto medio obtiene las mayores correlaciones de la ablación: r=0,219 en Agreeableness y 0,214 en Conscientiousness.
  • El contexto completo aumenta RMSE para Agreeableness, Conscientiousness y Neuroticism frente al contexto corto.
  • La ablación no muestra una mejora monótona con más contexto ni una ventaja consistente del texto completo.
  • CoT no mejora sistemáticamente la correlación o el error y reduce de forma marcada la concordancia entre modelos.
  • El suplemento publica un único ejemplo CoT; sus explicaciones no se puntúan contra evidencia humana ni se someten a pruebas de fidelidad.
  • La Figura 2 se titula comparación de tres LLM aunque contiene cuatro filas de modelos.
  • El texto afirma que kappa de la ablación permanece por debajo de 0,01, pero la misma sección reporta hasta 0,088; probablemente quiso decir 0,1.
  • Métodos define longitudes en palabras y Resultados las redefine como tokens.
  • La conclusión empírica central sí está respaldada: la alineación individual con el BFI-10 es débil bajo las condiciones estudiadas.

Limitaciones

  • La muestra agrupa varios estudios de adversidad y transición sin detallar tamaños, criterios y protocolos por cohorte.
  • No se demuestra representatividad de la población estadounidense ni de conversaciones de uso ordinario.
  • La etiqueta real-world puede inducir a pensar en diálogo natural espontáneo, pero el material procede de entrevistas de investigación estandarizadas.
  • De 555 participantes, 37 se excluyen por BFI-10 incompleto o inválido sin flujo, motivos ni comparación de excluidos.
  • Los conteos raciales suman 553 y los dos valores restantes no se explican.
  • No se ofrecen desgloses por estudio, edad, sexo, raza, educación u otras variables para evaluar heterogeneidad o fairness.
  • Los datos privados contienen narrativas sensibles; no hay auditoría de privacidad de prompts, proveedor, retención o transferencia de datos.
  • El consentimiento original para estudios conductuales no aclara autorización específica para inferencia de personalidad mediante APIs de terceros.
  • La revisión ética fue eximida para el análisis secundario, pero no se proporcionan identificadores de los estudios o aprobaciones originales.
  • El BFI-10 usa solo dos ítems por rasgo y puede limitar la fiabilidad y cobertura del constructo.
  • No se reporta fiabilidad del BFI-10 en esta muestra ni error de medición del referente.
  • No se especifica cómo se invierten y agregan los ítems BFI-10 para producir los cinco rasgos de referencia.
  • El autoinforme de una sesión no es una verdad objetiva de rasgo y puede contener sesgo de respuesta, estado transitorio y error.
  • No hay informes de observadores, resultados conductuales, medidas clínicas ni criterios externos para triangulación.
  • La instrucción pide puntuar solo señales presentes en narrativas de estado y luego compara con rasgos estables, creando un desajuste de objetivo.
  • No se estima la atenuación máxima esperable por fiabilidad imperfecta del referente y disponibilidad limitada de señales.
  • Se eliminan mayúsculas, puntuación y stopwords, que pueden contener estilo, pronombres, negación y otras señales pertinentes.
  • NLTK incluye listas de stopwords cuyo tratamiento de negaciones debe especificarse; no se publica la versión ni la lista exacta.
  • El truncado de palabras repetidas y muletillas no tiene definición, umbral, código ni auditoría.
  • No existe una ablación de texto crudo frente a texto preprocesado.
  • No se analiza audio, prosodia, pausas, tono, interacción del entrevistador o dinámica conversacional.
  • Los modelos y endpoints no se fijan con identificadores versionados o snapshots reproducibles.
  • No se informan fechas de ejecución, región, proveedor de Meta-LLaMA/DeepSeek, seed ni políticas de actualización.
  • GPT-5-Mini usa decoding por defecto, por lo que no comparte una configuración controlada con los otros modelos.
  • No se reporta top-p/top-k, límite de salida, system prompt, retries, rate limits o fallos de API.
  • No se describe el parser de puntuaciones, la tasa de formatos inválidos, reparaciones o exclusiones de outputs.
  • No se publica código, prompts completos de BFI-10, outputs, tablas de datos derivadas ni entorno de análisis.
  • La privacidad puede justificar no liberar transcripciones, pero no impide liberar código, outputs desidentificados o agregados reproducibles.
  • No hay baseline de media, mediana, frecuencia de categorías, regresión lineal, embeddings o método NLP clásico.
  • No hay baseline humano con lectores expuestos exactamente al mismo texto preprocesado.
  • Sin baseline central, MAE y exact match no demuestran que el modelo use información individual.
  • No se comparan formalmente correlaciones dependientes entre modelos, prompts o longitudes.
  • Se evalúan decenas de correlaciones sin declarar corrección por multiplicidad.
  • El estudio enfatiza significación de algunas correlaciones pequeñas sin separar significación estadística de utilidad individual.
  • No hay intervalos para MAE, RMSE, exact match, off-by-one o kappa.
  • Kappa no es ponderado pese a que las categorías son ordinales, y no se acompaña de análisis de prevalencia.
  • Los umbrales de binning de autoinforme entero y predicción continua son distintos y no se justifican psicométricamente.
  • Off-by-one es casi vacuo con tres categorías y puede alcanzar 100% mediante predicciones centrales.
  • No se evalúa calibración por nivel del rasgo ni error condicionado en extremos.
  • Los histogramas y MAE agregados pueden ocultar desempeño distinto por subgrupo o cohorte.
  • La estabilidad se estudia solo en un modelo, 50 de 518 casos y tres ejecuciones.
  • El tipo exacto de ICC, single versus average measure, no se identifica en el artículo definitivo o suplemento.
  • Llamar internal consistency a repetibilidad de outputs confunde propiedades psicométricas diferentes.
  • Aleatorizar segmentos significa que las tres ejecuciones no reciben exactamente el mismo estímulo ordenado.
  • No se proporcionan intervalos de los ICC de repetibilidad ni sensibilidad a seed/temperatura.
  • La concordancia intermodelo excluye GPT-5-Mini sin justificación.
  • Tratar tres modelos como una muestra aleatoria de raters para ICC(2,1) es una generalización fuerte con muy pocos raters seleccionados.
  • Los p-values de algunos ICC no concuerdan intuitivamente con intervalos que incluyen cero y no se explica el procedimiento.
  • La ablación toma prefijos, por lo que longitud, orden de preguntas y tipo de contenido cambian a la vez.
  • El artículo alterna palabras y tokens para 100/1.000 sin resolver cuál fue la unidad real.
  • No se aleatorizan fragmentos, preguntas o ventanas para aislar cantidad de contexto.
  • La prueba χ² de longitud no identifica prueba, grados de libertad, estructura repetida, post-hoc o tamaño del efecto.
  • Probar que cambia la distribución de predicciones no prueba que cambie la exactitud.
  • No se corrigen las múltiples pruebas de longitud por cinco rasgos.
  • CoT visible no constituye interpretabilidad por sí mismo y puede ser una racionalización no fiel.
  • El ejemplo CoT contiene inferencias causales y de rasgo no validadas; no se evalúan sistemáticamente sus razones.
  • No se realiza análisis factorial, convergente, discriminante, incremental o predictivo para validar el constructo.
  • No hay preregistro, separación exploratoria/confirmatoria ni conjunto de desarrollo independiente para prompts y decisiones analíticas.
  • No se estudia sensibilidad a formulaciones de prompt, idioma, transcripción o orden de preguntas.
  • Solo se evalúa inglés y una muestra estadounidense.
  • No se evalúan daños, consentimiento operativo, explicabilidad para afectados ni uso indebido en empleo, educación, seguros o salud.
  • La versión publicada conserva errores editoriales: Figura 2 dice tres modelos aunque muestra cuatro; el límite kappa <0,01 contradice 0,088; Table Y queda sin resolver en el suplemento.
  • La afirmación de ecological validity es más amplia que el diseño: varias cohortes de investigación no equivalen a contextos de despliegue.
  • No hay validación externa en otra muestra, otro protocolo de entrevista, conversación libre o periodo temporal.
  • No se evalúa drift de modelos propietarios ni reproducibilidad después de actualizaciones de API.

Qué no demuestra

  • No establece que los LLM infieran de forma fiable la personalidad de una persona.
  • No establece que el BFI-10 autoinformado sea ground truth objetiva.
  • No demuestra validez clínica, diagnóstica, laboral, educativa o forense.
  • No demuestra superioridad sobre un predictor de la media o cualquier baseline sencillo.
  • No demuestra superioridad sobre evaluadores humanos que lean la misma información.
  • No demuestra que off-by-one alto represente exactitud útil.
  • No demuestra alta estabilidad de los cuatro modelos; solo repite GPT-4.1-Mini en 50 casos.
  • No demuestra que CoT mejore precisión o produzca razonamiento fiel e interpretable.
  • No demuestra que más contexto mejore de forma monotónica la inferencia.
  • No aísla longitud de entrada respecto a posición, pregunta y contenido.
  • No demuestra generalización desde entrevistas guionizadas a conversaciones espontáneas.
  • No demuestra generalización fuera de adultos estadounidenses o de contextos adversos/transicionales.
  • No demuestra fairness entre sexos, edades, grupos raciales, educación o cohortes.
  • No permite reproducir el benchmark sin datos, código, outputs y modelos versionados.
  • No establece que las explicaciones CoT sean evidencia causal de cómo el modelo obtuvo la puntuación.
  • No justifica usar estas predicciones para tomar decisiones sobre personas.

Trazabilidad

Alcance: Texto completo

Versión: Journal of Psychiatry and Brain Science 2025;10(6):e250020; DOI 10.20900/jpbs.20250020; published 31 December 2025; 25-page article plus 6-page official supplement; arXiv:2507.14355v1 retained as superseded source

Fuente consultada: https://jpbs.hapres.com/UpLoad/PdfFile/JPBS_1832.pdf

Revisión: Codex definitive-version reconciliation, complete bilingual full-text fidelity pass, all-page visual inspection of article, supplement and superseded preprint, supplementary-table audit, construct-validity and data-quality review; summaries written from the full evidence rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4.1-Mini via OpenAI API; temperature 0.2
  • GPT-5-Mini via OpenAI API; provider-default decoding because temperature was not configurable
  • Meta-LLaMA-3.3-70B-Instruct-Turbo; provider and exact endpoint not reported
  • DeepSeek-R1-Distill-70B; provider and exact endpoint not reported

Instrumentos y métricas

  • BFI-10 same-session self-report reference on a 1–5 Likert scale
  • Direct zero-shot BFI-10 item prediction
  • Direct zero-shot Big Five trait prediction
  • Chain-of-thought Big Five trait prediction with visible rationales
  • Pearson correlation with 95% confidence interval and Spearman rank correlation
  • Mean absolute error and root mean squared error
  • Three-bin exact match, off-by-one rate and unweighted Cohen kappa
  • Within-model ICC coefficients across three GPT-4.1-Mini runs; exact ICC form not reported in the definitive version
  • Inter-model ICC(2,1) across three models, excluding GPT-5-Mini
  • Input-length ablation on the first 100, first 1,000 and full transcript

Datos utilizados

  • Private pooled dataset of 555 U.S. adult semi-structured research interviews about adjustment to adverse or transitional life events
  • Analysis subset of 518 participants with complete and valid BFI-10 scores
  • BFI-10 self-report collected in the same session as the interview
  • Random 50-participant subset used only for three-run GPT-4.1-Mini repeatability analysis
  • No public participant-level dataset, model outputs, code, or reproducible analysis package

Evidencia y localización

  • Publicación definitiva, DOI, fechas, licencia y autoría: Publisher article front matter, page 1, and official detail page
  • Muestra, entrevistas, demografía, preprocesamiento y 518 casos analizados: Definitive article Materials and Methods, page 4; Supplement Tables S1–S2
  • Modelos y configuración de decoding: Definitive article LLMs and Prompting Strategies, page 5
  • Prompts directos y CoT: Definitive article pages 5–6; Supplement Boxes S1–S2, pages 5–6
  • Métricas y bins: Definitive article Evaluation Metrics, page 6
  • Correlaciones por ítem con IC95%, MAE y RMSE: Supplement Table S3, pages 1–2
  • Correlaciones por rasgo, prompting y modelos: Supplement Table S4, pages 2–3
  • Distribuciones, exact match, off-by-one y kappa: Definitive article Figures 3–4 and 6–8, pages 9–14
  • Repetibilidad limitada a GPT-4.1-Mini, 50 participantes y tres runs: Definitive article page 6 and pages 14–15; Supplement Tables S5–S6, page 3
  • Concordancia entre tres modelos y exclusión de GPT-5-Mini: Supplement Tables S7–S9, pages 3–4
  • Ablación de longitud y contradicción words/tokens: Definitive article pages 6–7 and 15–17; Supplement Figures S1–S2, pages 4–5
  • Ejemplo de razonamiento CoT no validado: Supplement Box 3, page 6
  • Limitaciones reconocidas por los autores: Definitive article Limitations, page 20
  • Datos no disponibles por restricciones de privacidad: Definitive article Data Availability, page 21
  • Errores editoriales y contradicciones internas: Definitive article Figure 2 caption page 8; length units pages 6 and 15; kappa text page 16; Supplement Table S9 note page 4
  • Inspección visual: All 25 definitive article pages, all 6 supplement pages, and all 21 superseded arXiv v1 pages rendered and visually inspected on 15 July 2026