PTCBENCH: Benchmarking Contextual Stability of Personality Traits in LLM Systems

Personas, identidad y agentes2026arXivRevisión editorial aprobada

Autores: Jiongchi Yu, Yuhan Ma, Xiaoyu Zhang, Junjie Wang, Qiang Hu, Chao Shen, Xiaofei Xie

Palabras clave: Large Language Models, Personality, Persona, Personality Control, Model Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

7
Autores
9
Hallazgos
40
Limitaciones
13
Evidencias

Resumen editorial

Español

PTCBENCH estudia cuánto cambian las puntuaciones Big Five de sistemas basados en LLM cuando una evaluación NEO-FFI se sitúa en distintos contextos. Incluye cuatro modelos base, Gemini 2.0 Flash, GPT-4o-mini, Claude Sonnet 4 y GPT-OSS-120b, y dos agentes, AutoGen y CAMEL, ambos con GPT-4o-mini como backbone. El diseño combina seis lugares con seis eventos vitales. Aunque el artículo habla de “12 condiciones”, cada prompt situado contiene simultáneamente un lugar y un evento: los resultados promediados públicos tienen 37 filas, una baseline más las 36 parejas factoriales. La cifra de 39.240 registros se reconstruye exactamente como 6 sistemas × (36 parejas × 3 repeticiones + 1 baseline) × 60 ítems. Por tanto, no son doce intervenciones aisladas y el efecto principal de lugar o evento se estima dentro de combinaciones construidas.

Cada sistema responde los 60 ítems NEO-FFI con opciones 1–5. El código suma doce ítems por rasgo e invierte los ítems negativos, por lo que produce rangos de 12–60; la ecuación del paper, en cambio, define una media 1–5 mientras las tablas informan sumas de hasta 60. Los perfiles nativos suelen mostrar Neuroticismo bajo y Apertura/Responsabilidad altas. Para lugares, la Tabla 1 informa coeficientes B humanos de 0,319–0,795 frente a 0,016–0,082 en modelos base, es decir, cambios menores en esa escala. Para eventos, la Tabla 2 ofrece rangos mucho mayores en Gemini, 0,904–6,271, que en GPT-4o-mini, 0,256–1,462, Claude, 0,071–0,114, o GPT-OSS, 0,086–0,137. No son métricas directamente intercambiables con los mapas de diferencias crudas o los efectos estandarizados del apéndice.

El artículo presenta perfiles high/medium/low que muestran control por instrucción en GPT-4o-mini. Por ejemplo, Apertura promedia 50,17/35,83/29,09; Responsabilidad 55,05/38,62/26,49; Extraversión 52,52/34,91/20,85; Amabilidad 51,05/42,03/25,67; y Neuroticismo 55,13/33,97/13,53. Esto demuestra que las etiquetas y descripciones del prompt desplazan respuestas del cuestionario, pero los techos, suelos y regresión hacia la media condicionan cuánto puede cambiar después cada perfil. El generador del repositorio crea 3^5=243 combinaciones; la “configuración 244” None descrita en el paper no forma parte de esa lista y solo puede sustituirse manualmente.

La estabilidad entre repeticiones se calcula mediante ICC(3,1) e ICC(3,k). En baseline/situación, GPT-4o-mini obtiene ICC(3,1) 0,67/0,64 y ICC(3,k) 0,91/0,85; Claude 0,87/0,79 y 0,97/0,94; Gemini 0,96/0,86 y 0,99/0,95; AutoGen 0,93/0,91 y 0,99/0,98; CAMEL 0,75/0,65 y 0,94/0,90. GPT-OSS no aparece en esa tabla. El código usa los cinco rasgos como targets y los runs como raters: mide la conservación del orden relativo de un perfil de solo cinco puntos, no consistencia interna del instrumento ni estabilidad ítem a ítem. Además, el apéndice afirma que cualquier resultado con ICC(3,k)<0,8 se repitió automáticamente, pero los outputs liberados conservan, por ejemplo, GPT-4o-mini en bar+divorce con ICC(3,k)=0,164 y bar+unemployment con 0,572.

El factor más importante para interpretar PTCBENCH es que la condición situada no cambia solo el contexto. El prompt público incluye la puntuación Big Five baseline, las 60 preguntas y respuestas baseline completas y, a medida que avanza, toda la conversación situada previa. El paper lo presenta como una historia “comprimida” o un pequeño subconjunto, pero el código acumula las 60 respuestas. De este modo, el contraste mezcla lugar, evento, anclaje explícito en las puntuaciones anteriores, memoria literal de respuestas, orden de ítems y longitud creciente del contexto. Los escenarios son instrucciones sintéticas de una línea, no entornos realistas que evolucionan. Los cambios no pueden atribuirse limpiamente al contexto situacional.

Los efectos estandarizados tampoco justifican comparaciones psicológicas fuertes. La Tabla 6 llega a valores como dE=-18,528 para Divorce en Neuroticismo de Gemini, con IC [-33,385,-3,671], debido a desviaciones baseline diminutas y pocos runs. En GPT-4o-mini, Claude y GPT-OSS la mayoría de intervalos cruza cero. El texto se contradice: primero afirma que las variaciones por lugar de los modelos base son menores que las humanas y después concluye que los LLM, “especialmente los foundation models”, cambian sustancialmente más. Escalas crudas, coeficientes de regresión y efectos estandarizados se alternan sin una reconciliación suficiente.

La prueba AGIEval no demuestra que una personalidad alterada cambie el razonamiento. Se ejecuta solo con GPT-OSS-120b y selecciona retrospectivamente, para cada rasgo, las tres parejas lugar-evento que más desviaron ese rasgo. El script añade a cada pregunta AGIEval únicamente el texto de lugar y evento; no añade ni interviene una puntuación de personalidad, un perfil, las respuestas NEO-FFI o un estado mediador. La diferencia de accuracy es por tanto un efecto directo del contexto textual seleccionado, no una estimación causal del efecto de personalidad. La misma pareja se etiqueta bajo varios rasgos y produce filas idénticas: Vehicle+Unemployment se repite para Responsabilidad y Extraversión; Home+Unemployment para Responsabilidad, Extraversión y Neuroticismo; Vehicle+Divorce para Responsabilidad, Amabilidad y Neuroticismo.

La Tabla 8 informa mejora media positiva en las quince condiciones seleccionadas, entre +0,0065 y +0,0439 de accuracy absoluta. Esto contradice la narrativa de que descensos en Responsabilidad/Extraversión o aumentos en Neuroticismo degradan el razonamiento; el Finding 5 encuadrado incluso dice que el estrés tiende a mejorarlo, mientras la discusión vuelve a describir degradación. La afirmación “hasta +20 % en AGIEval global” no está respaldada por la tabla: el máximo promedio es +4,39 puntos porcentuales; aproximadamente 20 % corresponde al cambio de rasgo, no al cambio global de accuracy. No hay repetición independiente, intervalos, tests, corrección por selección de máximos ni identificación de mediación.

Existe un repositorio público, FishAnonymous/PTCBench, auditado en el commit 6545f85f1cb13e16816d28e674bd7b2ff6352725, publicado después de arXiv v1 y no enlazado desde el paper o la ficha oficial. Contiene unos 397 MB y 86.932 archivos versionados, sobre todo outputs crudos, pero carece de licencia, tests, CI, requirements, pyproject, lockfile, contenedor y comandos de instalación o ejecución. El README menciona carpetas camel/ y figures/ ausentes; tampoco existe el Dockerfile que el paper afirma proporcionar. La reproducción con Python 3.10+, único requisito declarado, falla de inmediato por ModuleNotFoundError: statsmodels. Instalar dependencias actuales no constituiría una reproducción fiel porque no hay versiones fijadas.

La auditoría de código detecta además divergencias materiales: big5.py genera 50 preguntas ad hoc aunque las llama NEO_FFI_60; el pipeline real usa otro CSV inglés de 60 ítems; las credenciales y el modelo se seleccionan editando globals; no se crean directorios; una respuesta que no contiene 1–5 se convierte silenciosamente en 3 y una excepción en 0; si los cinco rasgos suman 36 se descarta el run, aunque un perfil neutral puede ser válido; al reparar un cero situado se llama por error al prompt baseline; y la lista de tareas se acumula entre repeticiones. Los outputs mezclan tres y cinco runs según modelo, en conflicto con las descripciones del paper, y el código ICC exige cinco índices aunque los resultados de Gemini contienen tres.

PTCBENCH es valioso como corpus de estrés contextual y como señal de que respuestas de autoinforme generadas por LLM son sensibles al prompt, al historial y al proveedor. No establece personalidad auténtica, equivalencia psicométrica con humanos, cambio longitudinal ni efecto causal de personalidad sobre razonamiento. Su contribución debe presentarse como benchmark exploratorio con artefactos parcialmente auditables, no como prueba de que eventos vitales producen cambios psicológicos reales o de que esos cambios causan una pérdida de capacidad.

English

PTCBENCH studies how Big Five scores from LLM-based systems change when a NEO-FFI assessment is situated in different contexts. It includes four foundation models, Gemini 2.0 Flash, GPT-4o-mini, Claude Sonnet 4, and GPT-OSS-120b, and two agents, AutoGen and CAMEL, both using GPT-4o-mini as their backbone. The design combines six locations with six life events. Although the paper describes “12 external conditions,” every situated prompt contains both a location and an event: the released averaged results have 37 rows, one baseline plus 36 factorial pairs. The reported 39,240 records reconstruct exactly as 6 systems × (36 pairs × 3 repetitions + 1 baseline) × 60 items. These are therefore not twelve isolated interventions, and location or event effects are estimated within constructed combinations.

Each system answers the 60 NEO-FFI items using options 1–5. The code sums twelve items per trait and reverse-scores negative-keyed items, producing a 12–60 range; the paper's equation instead defines a 1–5 average while its tables report sums up to 60. Native profiles generally show low Neuroticism and high Openness/Conscientiousness. For locations, Table 1 reports human B coefficients of 0.319–0.795 versus 0.016–0.082 for foundation models, meaning smaller model changes on that scale. For events, Table 2 gives much larger ranges for Gemini, 0.904–6.271, than GPT-4o-mini, 0.256–1.462, Claude, 0.071–0.114, or GPT-OSS, 0.086–0.137. These metrics are not directly interchangeable with raw-difference heatmaps or appendix standardized effects.

High/medium/low preset profiles demonstrate instruction control in GPT-4o-mini. Openness, for example, averages 50.17/35.83/29.09; Conscientiousness 55.05/38.62/26.49; Extraversion 52.52/34.91/20.85; Agreeableness 51.05/42.03/25.67; and Neuroticism 55.13/33.97/13.53. This shows that prompt labels and descriptions shift questionnaire answers, but ceilings, floors, and regression toward the mean constrain how much each profile can subsequently change. The repository generator creates 3^5=243 combinations; the paper's “244th” None control is not in that generated list and can only be substituted manually.

Across-run stability is calculated through ICC(3,1) and ICC(3,k). For baseline/situated conditions, GPT-4o-mini reports ICC(3,1) 0.67/0.64 and ICC(3,k) 0.91/0.85; Claude 0.87/0.79 and 0.97/0.94; Gemini 0.96/0.86 and 0.99/0.95; AutoGen 0.93/0.91 and 0.99/0.98; and CAMEL 0.75/0.65 and 0.94/0.90. GPT-OSS is omitted. The code treats the five traits as targets and runs as raters, so the statistic captures preservation of the rank ordering of a five-point profile, not instrument internal consistency or item-level stability. The appendix also says any ICC(3,k)<0.8 was rerun automatically, yet released outputs retain GPT-4o-mini bar+divorce at ICC(3,k)=0.164 and bar+unemployment at 0.572.

The most important interpretive issue is that the situated condition does not change context alone. The public prompt includes the baseline Big Five score, all 60 baseline questions and answers, and, as the questionnaire progresses, all prior situated conversation. The paper calls this a “compressed” history or a small subset, but the code accumulates the full 60-answer record. The comparison therefore mixes location, event, explicit anchoring on prior scores, verbatim answer recall, item order, and growing context length. Scenarios are synthetic one-line instructions, not realistic evolving environments. Changes cannot be cleanly attributed to situational context.

Standardized effects do not support strong psychological comparisons either. Table 6 reaches values such as dE=-18.528 for Divorce on Gemini Neuroticism, CI [-33.385,-3.671], driven by tiny baseline standard deviations and few runs. Most intervals for GPT-4o-mini, Claude, and GPT-OSS cross zero. The prose is internally inconsistent: it first says foundation-model location changes are smaller than human changes, then concludes LLMs, “especially foundation models,” change substantially more. Raw sums, regression coefficients, and standardized effects are alternated without adequate reconciliation.

The AGIEval experiment does not show that altered personality changes reasoning. It runs only on GPT-OSS-120b and retrospectively selects, for each trait, the three location-event pairs producing the largest trait deviation. The script adds only the location-event text to each AGIEval question; it does not add or intervene on a personality score, profile, NEO-FFI answer history, or mediating state. Accuracy differences are therefore direct effects of selected context text, not causal estimates of personality effects. The same pair is assigned multiple trait labels and yields identical rows: Vehicle+Unemployment appears for Conscientiousness and Extraversion; Home+Unemployment for Conscientiousness, Extraversion, and Neuroticism; and Vehicle+Divorce for Conscientiousness, Agreeableness, and Neuroticism.

Table 8 reports a positive average improvement in all fifteen selected conditions, from +0.0065 to +0.0439 absolute accuracy. This conflicts with the narrative that decreases in Conscientiousness/Extraversion or increases in Neuroticism degrade reasoning; the boxed Finding 5 even says stress tends to improve reasoning, while the discussion reverts to degradation. The “up to +20% overall AGIEval” claim is not supported by the table: the largest mean change is +4.39 percentage points; roughly 20% refers to trait change, not overall accuracy. There is no independent replication, uncertainty, significance test, correction for selecting maxima, or mediation identification.

A public repository, FishAnonymous/PTCBench, was audited at commit 6545f85f1cb13e16816d28e674bd7b2ff6352725. It was released after arXiv v1 and is not linked by the paper or official record. It contains roughly 397 MB and 86,932 tracked files, mainly raw outputs, but has no license, tests, CI, requirements, pyproject, lockfile, container, or installation and execution commands. The README names missing camel/ and figures/ directories; the Dockerfile claimed by the paper is also absent. A reproduction attempt under Python 3.10+, the only declared requirement, fails immediately with ModuleNotFoundError: statsmodels. Installing current dependencies would not be faithful reproduction because no versions are pinned.

The code audit found additional material divergences: big5.py creates 50 ad hoc questions while naming its output NEO_FFI_60; the actual pipeline uses a different English 60-item CSV; credentials and model are selected by editing globals; output directories are not created; an answer lacking 1–5 silently becomes 3 and an exception becomes 0; a run is discarded when all five traits sum to 36 even though a neutral profile may be valid; repairing a zero situated response mistakenly invokes the baseline prompt; and the task list accumulates between repetitions. Released outputs mix three and five runs by model, conflicting with paper descriptions, and the ICC code requires five indices even though Gemini results have three.

PTCBENCH is useful as a contextual stress-test corpus and as evidence that LLM-generated self-report answers are sensitive to prompts, history, and provider. It does not establish authentic personality, psychometric equivalence to humans, longitudinal personality change, or a causal personality effect on reasoning. Its contribution should be described as an exploratory benchmark with partially auditable artifacts, not proof that life events produce real psychological change or that such change causes capability loss.

Pregunta de investigación

¿Hasta qué punto cambian las respuestas NEO-FFI de modelos y agentes al combinar lugares y eventos vitales, y puede relacionarse esa variación con el rendimiento en AGIEval?

Método

Se administra NEO-FFI de 60 ítems a cuatro modelos base y dos agentes en baseline y en las 36 combinaciones de seis lugares por seis eventos. Se comparan sumas Big Five, regresiones, efectos estandarizados e ICC entre runs. En GPT-OSS se seleccionan post hoc tres escenarios de máxima desviación por rasgo y se antepone su texto a preguntas AGIEval. La auditoría también reproduce la aritmética del corpus y contrasta paper, código y outputs del repositorio público fijado a commit.

Muestra: El paper declara 39.240 registros de ítem: 6 sistemas × (36 combinaciones × 3 repeticiones + 1 baseline) × 60 ítems. Los outputs públicos no mantienen un único número de runs: AutoGen, CAMEL, GPT-4o-mini y Claude muestran cinco índices; Gemini y GPT-OSS, tres. Los promedios tienen 37 condiciones por sistema. La evaluación AGIEval usa solo GPT-OSS y 15 filas seleccionadas post hoc, con escenarios repetidos entre etiquetas de rasgo.

Hallazgos

  • Los outputs confirman una baseline y las 36 parejas lugar-evento; “12 condiciones” no describe doce intervenciones independientes.
  • El control high/medium/low desplaza fuertemente las sumas NEO-FFI de GPT-4o-mini, compatible con seguimiento de instrucciones.
  • Los coeficientes por lugar de modelos base son menores que los humanos en la Tabla 1, mientras Gemini muestra efectos por evento mucho mayores en otra escala.
  • La mayoría de intervalos estandarizados de GPT-4o-mini, Claude y GPT-OSS cruza cero; los valores extremos de Gemini reflejan denominadores baseline muy pequeños.
  • Los ICC publicados son altos en promedio, pero miden el ranking de cinco rasgos entre runs y los outputs contienen celdas por debajo del umbral de rerun declarado.
  • La condición situada incluye puntuaciones y las 60 respuestas baseline, por lo que no aísla el efecto del lugar o evento.
  • Las quince condiciones AGIEval seleccionadas tienen mejora media positiva de +0,65 a +4,39 puntos porcentuales absolutos.
  • El script AGIEval modifica contexto, no personalidad; no identifica un efecto causal de rasgos sobre razonamiento.
  • El repositorio aporta outputs crudos extensos, pero no un entorno instalable y reproducible ni concordancia plena con el paper.

Limitaciones

  • Cada condición situada combina lugar y evento; no son doce tratamientos aislados.
  • No se presenta una descomposición factorial transparente con interacción lugar×evento para todas las conclusiones.
  • El contraste mezcla escenario, puntuación baseline, las 60 respuestas baseline, historial situado, orden y longitud de contexto.
  • La historia no es un pequeño subconjunto: el código incorpora todas las preguntas y respuestas baseline.
  • Los lugares y eventos son instrucciones sintéticas de una línea, no entornos realistas o longitudinales.
  • NEO-FFI es un autoinforme humano trasladado a generación textual sin validación de equivalencia de medida.
  • La ecuación del paper define medias 1–5, pero el código y las tablas usan sumas 12–60.
  • El reverse scoring es decisivo y está en el código, pero no queda explicado con precisión suficiente en el método.
  • La lista automática contiene 243 perfiles; el control None número 244 no está incluido en ella.
  • Los perfiles high y low sufren techo, suelo y regresión matemática, confundiendo sensibilidad contextual.
  • Los modelos API carecen de snapshots y fechas ejecutables suficientes para reconstruir exactamente la muestra.
  • El número de repeticiones es inconsistente entre método, apéndice, código y outputs públicos.
  • ICC usa solo cinco targets y evalúa orden del perfil, no consistencia interna de 60 ítems.
  • Algunos outputs liberados incumplen el rerun automático para ICC(3,k)<0,8 declarado en el paper.
  • El código ICC excluye grupos con menos de cinco índices, pero los outputs de Gemini tienen tres.
  • GPT-OSS se omite de la tabla ICC principal sin una justificación suficiente.
  • Las comparaciones con estudios humanos mezclan escalas, horizontes temporales y diseños no equivalentes.
  • Efectos estandarizados extremos se inflan cuando la desviación baseline es casi cero y n es pequeño.
  • Muchas comparaciones carecen de corrección por multiplicidad y de una estimación clara de incertidumbre.
  • El texto contiene conclusiones contradictorias sobre si los cambios de modelos base son menores o mayores que los humanos.
  • AGIEval selecciona escenarios post hoc por máxima desviación, introduciendo sesgo de selección.
  • AGIEval no manipula el rasgo ni incorpora un estado de personalidad; solo antepone texto contextual.
  • Las mismas parejas aparecen bajo varios rasgos, por lo que las filas no son evidencias independientes por constructo.
  • No se prueba mediación entre escenario, cambio NEO-FFI y accuracy de razonamiento.
  • No hay replicación, intervalos o tests para las diferencias AGIEval.
  • La narrativa de degradación contradice mejoras medias positivas en todas las filas de la Tabla 8.
  • El “+20 % overall AGIEval” confunde aproximadamente magnitud de rasgo con un máximo de +4,39 puntos de accuracy media.
  • No se evalúan persistencia al retirar el contexto, reversibilidad, recuperación o drift temporal real.
  • No hay participantes humanos, juicios de autenticidad, engagement, confianza o efectos sobre usuarios.
  • El repositorio apareció después de arXiv v1 y no está enlazado en la superficie oficial.
  • El repositorio no tiene licencia, tests, CI, manifest de dependencias, lockfile, setup ni instrucciones ejecutables.
  • El README y el paper mencionan carpetas y Dockerfile ausentes.
  • La ejecución con el único requisito declarado falla por una dependencia no declarada, statsmodels.
  • big5.py genera 50 preguntas ad hoc con un nombre de archivo que afirma 60; el pipeline principal usa otro instrumento.
  • El pipeline depende de globals, endpoints y claves placeholder editados manualmente.
  • Un parseo fallido se imputa silenciosamente como 3 y una excepción como 0, alterando la medición.
  • Se descartan runs con cinco puntuaciones iguales a 36, aunque un perfil neutral puede ser válido.
  • La reparación de ceros situados usa por error el prompt baseline.
  • La lista de tareas se acumula entre repeticiones y puede volver a ejecutar trabajo previo.
  • Los outputs crudos son voluminosos pero no se acompasan con un pipeline verificable de extremo a extremo.

Qué no demuestra

  • No establece que los LLM posean rasgos Big Five humanos o una personalidad auténtica.
  • No aísla el efecto causal de lugares o eventos sobre respuestas de personalidad.
  • No demuestra cambio longitudinal, persistente o espontáneo de personalidad.
  • No prueba que un cambio de puntuación NEO-FFI cause mejora o deterioro del razonamiento.
  • No justifica comparar directamente magnitudes de LLM y humanos como si fueran la misma medida.
  • No valida 244 configuraciones efectivamente ejecutables mediante el generador público.
  • No confirma que el mecanismo de rerun y la muestra publicada sigan el protocolo descrito.
  • No permite reproducción fiel desde cero con las instrucciones y dependencias publicadas.
  • No demuestra robustez en entornos realistas, usuarios, idiomas, culturas o despliegues prolongados.
  • No confirma peer review o publicación distinta del preprint arXiv v1.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2602.00016v1, submitted 12 January 2026; preprint, 28 pages

Fuente consultada: https://arxiv.org/pdf/2602.00016v1

Revisión: Codex full-text, bilingual-fidelity, 28-page visual, arXiv-v1, factorial-design, prompt-history, NEO-scoring, ICC, human-comparison, AGIEval-causal, claim-consistency, code, released-output and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Gemini 2.0 Flash, exact API snapshot unspecified
  • GPT-4o-mini, exact API snapshot unspecified
  • Claude Sonnet 4, exact API snapshot unspecified
  • GPT-OSS-120b, provider and serving configuration incompletely specified
  • AutoGen agent with GPT-4o-mini backbone
  • CAMEL agent with GPT-4o-mini backbone

Instrumentos y métricas

  • NEO Five-Factor Inventory, 60-item English questionnaire
  • Big Five summed trait scores with reverse-keyed items in code
  • High, medium, low and unspecified personality prompt configurations
  • Six synthetic locations crossed with six synthetic life events
  • Linear regression coefficient B
  • Standardized event effect dE with confidence intervals
  • ICC(3,1) and ICC(3,k) across runs over five trait targets
  • AGIEval context-prefixed reasoning evaluation

Datos utilizados

  • PTCBENCH released raw and averaged CSV outputs
  • 36 location-event combinations plus one baseline row per system
  • NEO-FFI 60-question English CSV used by the main pipeline
  • AGIEval scenarios and result JSON for GPT-OSS-120b
  • FishAnonymous/PTCBench repository at commit 6545f85f1cb13e16816d28e674bd7b2ff6352725

Evidencia y localización

  • Metadatos, versión, abstract y estado: Official arXiv:2602.00016v1 surface, submitted 12 January 2026
  • Diseño, sistemas, 39.240 registros y condiciones: Paper, pp. 3–7, Sections 3–4 and Figure 2
  • NEO-FFI, ecuación y configuraciones: Paper, pp. 5–7 and 19–21, Equations 1–2, Tables 3 and 5, Appendix A
  • Efectos de lugar y evento: Paper, pp. 7–10 and 21–24, Tables 1–2 and 5–6, Figures 3–5
  • ICC y protocolo de rerun: Paper, pp. 10–11 and 19–21, Table 4 and Appendix A.2
  • AGIEval y afirmaciones de razonamiento: Paper, pp. 11–13 and 24–27, Section 5.4, Table 8 and Appendix A.4
  • Contradicciones entre resultados y discusión: Paper, pp. 8, 12–14 and 23–27, Findings 2 and 5, Table 8 and discussion
  • Prompts completos, scoring, generación y errores de ejecución: FishAnonymous/PTCBench at commit 6545f85f1cb13e16816d28e674bd7b2ff6352725, src/1personality.py, config.py and big5.py, audited 15 July 2026
  • Cálculo ICC y divergencias de runs: FishAnonymous/PTCBench at commit 6545f85f1cb13e16816d28e674bd7b2ff6352725, ICC scripts and released result CSVs, audited 15 July 2026
  • Intervención AGIEval solo contextual: FishAnonymous/PTCBench at commit 6545f85f1cb13e16816d28e674bd7b2ff6352725, src/1agieval_scenario_test.py and exp_result/gptoss/scenario_results.json
  • Estado de reproducibilidad del repositorio: FishAnonymous/PTCBench at commit 6545f85f1cb13e16816d28e674bd7b2ff6352725, repository root and README; clean-environment entry-point attempt audited 15 July 2026
  • Inspección visual integral: Paper, all 28 rendered pages, including every table, figure, formula, prompt and appendix page
  • Relación entre paper y repositorio: Official arXiv surface and paper checked 15 July 2026; public repository found separately and dated after arXiv v1