PTCBENCH estudia cuánto cambian las puntuaciones Big Five de sistemas basados en LLM cuando una evaluación NEO-FFI se sitúa en distintos contextos. Incluye cuatro modelos base, Gemini 2.0 Flash, GPT-4o-mini, Claude Sonnet 4 y GPT-OSS-120b, y dos agentes, AutoGen y CAMEL, ambos con GPT-4o-mini como backbone. El diseño combina seis lugares con seis eventos vitales. Aunque el artículo habla de “12 condiciones”, cada prompt situado contiene simultáneamente un lugar y un evento: los resultados promediados públicos tienen 37 filas, una baseline más las 36 parejas factoriales. La cifra de 39.240 registros se reconstruye exactamente como 6 sistemas × (36 parejas × 3 repeticiones + 1 baseline) × 60 ítems. Por tanto, no son doce intervenciones aisladas y el efecto principal de lugar o evento se estima dentro de combinaciones construidas.
Cada sistema responde los 60 ítems NEO-FFI con opciones 1–5. El código suma doce ítems por rasgo e invierte los ítems negativos, por lo que produce rangos de 12–60; la ecuación del paper, en cambio, define una media 1–5 mientras las tablas informan sumas de hasta 60. Los perfiles nativos suelen mostrar Neuroticismo bajo y Apertura/Responsabilidad altas. Para lugares, la Tabla 1 informa coeficientes B humanos de 0,319–0,795 frente a 0,016–0,082 en modelos base, es decir, cambios menores en esa escala. Para eventos, la Tabla 2 ofrece rangos mucho mayores en Gemini, 0,904–6,271, que en GPT-4o-mini, 0,256–1,462, Claude, 0,071–0,114, o GPT-OSS, 0,086–0,137. No son métricas directamente intercambiables con los mapas de diferencias crudas o los efectos estandarizados del apéndice.
El artículo presenta perfiles high/medium/low que muestran control por instrucción en GPT-4o-mini. Por ejemplo, Apertura promedia 50,17/35,83/29,09; Responsabilidad 55,05/38,62/26,49; Extraversión 52,52/34,91/20,85; Amabilidad 51,05/42,03/25,67; y Neuroticismo 55,13/33,97/13,53. Esto demuestra que las etiquetas y descripciones del prompt desplazan respuestas del cuestionario, pero los techos, suelos y regresión hacia la media condicionan cuánto puede cambiar después cada perfil. El generador del repositorio crea 3^5=243 combinaciones; la “configuración 244” None descrita en el paper no forma parte de esa lista y solo puede sustituirse manualmente.
La estabilidad entre repeticiones se calcula mediante ICC(3,1) e ICC(3,k). En baseline/situación, GPT-4o-mini obtiene ICC(3,1) 0,67/0,64 y ICC(3,k) 0,91/0,85; Claude 0,87/0,79 y 0,97/0,94; Gemini 0,96/0,86 y 0,99/0,95; AutoGen 0,93/0,91 y 0,99/0,98; CAMEL 0,75/0,65 y 0,94/0,90. GPT-OSS no aparece en esa tabla. El código usa los cinco rasgos como targets y los runs como raters: mide la conservación del orden relativo de un perfil de solo cinco puntos, no consistencia interna del instrumento ni estabilidad ítem a ítem. Además, el apéndice afirma que cualquier resultado con ICC(3,k)<0,8 se repitió automáticamente, pero los outputs liberados conservan, por ejemplo, GPT-4o-mini en bar+divorce con ICC(3,k)=0,164 y bar+unemployment con 0,572.
El factor más importante para interpretar PTCBENCH es que la condición situada no cambia solo el contexto. El prompt público incluye la puntuación Big Five baseline, las 60 preguntas y respuestas baseline completas y, a medida que avanza, toda la conversación situada previa. El paper lo presenta como una historia “comprimida” o un pequeño subconjunto, pero el código acumula las 60 respuestas. De este modo, el contraste mezcla lugar, evento, anclaje explícito en las puntuaciones anteriores, memoria literal de respuestas, orden de ítems y longitud creciente del contexto. Los escenarios son instrucciones sintéticas de una línea, no entornos realistas que evolucionan. Los cambios no pueden atribuirse limpiamente al contexto situacional.
Los efectos estandarizados tampoco justifican comparaciones psicológicas fuertes. La Tabla 6 llega a valores como dE=-18,528 para Divorce en Neuroticismo de Gemini, con IC [-33,385,-3,671], debido a desviaciones baseline diminutas y pocos runs. En GPT-4o-mini, Claude y GPT-OSS la mayoría de intervalos cruza cero. El texto se contradice: primero afirma que las variaciones por lugar de los modelos base son menores que las humanas y después concluye que los LLM, “especialmente los foundation models”, cambian sustancialmente más. Escalas crudas, coeficientes de regresión y efectos estandarizados se alternan sin una reconciliación suficiente.
La prueba AGIEval no demuestra que una personalidad alterada cambie el razonamiento. Se ejecuta solo con GPT-OSS-120b y selecciona retrospectivamente, para cada rasgo, las tres parejas lugar-evento que más desviaron ese rasgo. El script añade a cada pregunta AGIEval únicamente el texto de lugar y evento; no añade ni interviene una puntuación de personalidad, un perfil, las respuestas NEO-FFI o un estado mediador. La diferencia de accuracy es por tanto un efecto directo del contexto textual seleccionado, no una estimación causal del efecto de personalidad. La misma pareja se etiqueta bajo varios rasgos y produce filas idénticas: Vehicle+Unemployment se repite para Responsabilidad y Extraversión; Home+Unemployment para Responsabilidad, Extraversión y Neuroticismo; Vehicle+Divorce para Responsabilidad, Amabilidad y Neuroticismo.
La Tabla 8 informa mejora media positiva en las quince condiciones seleccionadas, entre +0,0065 y +0,0439 de accuracy absoluta. Esto contradice la narrativa de que descensos en Responsabilidad/Extraversión o aumentos en Neuroticismo degradan el razonamiento; el Finding 5 encuadrado incluso dice que el estrés tiende a mejorarlo, mientras la discusión vuelve a describir degradación. La afirmación “hasta +20 % en AGIEval global” no está respaldada por la tabla: el máximo promedio es +4,39 puntos porcentuales; aproximadamente 20 % corresponde al cambio de rasgo, no al cambio global de accuracy. No hay repetición independiente, intervalos, tests, corrección por selección de máximos ni identificación de mediación.
Existe un repositorio público, FishAnonymous/PTCBench, auditado en el commit 6545f85f1cb13e16816d28e674bd7b2ff6352725, publicado después de arXiv v1 y no enlazado desde el paper o la ficha oficial. Contiene unos 397 MB y 86.932 archivos versionados, sobre todo outputs crudos, pero carece de licencia, tests, CI, requirements, pyproject, lockfile, contenedor y comandos de instalación o ejecución. El README menciona carpetas camel/ y figures/ ausentes; tampoco existe el Dockerfile que el paper afirma proporcionar. La reproducción con Python 3.10+, único requisito declarado, falla de inmediato por ModuleNotFoundError: statsmodels. Instalar dependencias actuales no constituiría una reproducción fiel porque no hay versiones fijadas.
La auditoría de código detecta además divergencias materiales: big5.py genera 50 preguntas ad hoc aunque las llama NEO_FFI_60; el pipeline real usa otro CSV inglés de 60 ítems; las credenciales y el modelo se seleccionan editando globals; no se crean directorios; una respuesta que no contiene 1–5 se convierte silenciosamente en 3 y una excepción en 0; si los cinco rasgos suman 36 se descarta el run, aunque un perfil neutral puede ser válido; al reparar un cero situado se llama por error al prompt baseline; y la lista de tareas se acumula entre repeticiones. Los outputs mezclan tres y cinco runs según modelo, en conflicto con las descripciones del paper, y el código ICC exige cinco índices aunque los resultados de Gemini contienen tres.
PTCBENCH es valioso como corpus de estrés contextual y como señal de que respuestas de autoinforme generadas por LLM son sensibles al prompt, al historial y al proveedor. No establece personalidad auténtica, equivalencia psicométrica con humanos, cambio longitudinal ni efecto causal de personalidad sobre razonamiento. Su contribución debe presentarse como benchmark exploratorio con artefactos parcialmente auditables, no como prueba de que eventos vitales producen cambios psicológicos reales o de que esos cambios causan una pérdida de capacidad.