Evaluating the Efficacy of LLMs to Emulate Realistic Human Personalities

Evaluación y validez psicométrica2024AAAI ProceedingsRevisión editorial aprobada

Autores: Lawrence J. Klinkert, Steph Buongiorno, Corey Clark

Palabras clave: personality emulation, NPC behavior, game AI, personality alignment, human-like traits, LLM evaluation, interactive agents

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
32
Hallazgos
50
Limitaciones
31
Evidencias

Resumen editorial

Español

El artículo propone un benchmark para comprobar si siete LLM responden el IPIP-50 de forma compatible con uno de veinte perfiles Big Five objetivo, pensando en su uso posterior para personajes de videojuegos. Parte de 1.015.342 cuestionarios humanos del Open-Source Psychometrics Project; tras exigir respuestas completas, un tiempo mínimo y la primera participación por IP, el texto declara 596.956 casos. Normaliza los cinco rasgos, asigna cada persona por distancia euclídea al perfil más cercano y forma una referencia equilibrada de 50.500 personas, 2.525 por perfil. Los veinte prototipos no proceden de una taxonomía validada en el estudio, sino de una página web de 2018, e incluyen nombres tomados de trastornos y supuestos opuestos que aquí funcionan solo como etiquetas no diagnósticas. Para cada perfil, el prompt entrega al modelo el vector OCEAN exacto y pide responder por separado los 50 ítems con una escala Likert de 1 a 5. La tabla principal publica exactitudes de clasificación al centroide de 5,00 % para Flan-T5-XL, 5,00 % para Flan-T5-XXL, 15,10 % para text-davinci-003, 31,90 % para GPT-3.5, 74,00 % para GPT-4, 7,11 % para Dolphin-2.7-Mixtral y 6,33 % para Mixtral-8x7B-Instruct. El 100 % destacado en el abstract no es exactitud global: la Tabla 4 muestra que, en perfiles concretos, todas las respuestas de GPT-4 caen dentro de la envolvente convexa de la nube humana; es una métrica diferente. La auditoría del artefacto GitLab permite recomputar aproximadamente 5,00 %, 5,00 %, 15,08 %, 31,90 %, 71,64 %, 7,11 % y 5,16 %, por lo que las cifras públicas de GPT-4 y Mixtral no coinciden con el artículo. También aparecen tamaños de muestra de 3, 64 o 128 repeticiones por perfil, pese a que el texto afirma 64 para todos. La implementación filtra tiempos humanos por encima de 1.000 ms, no 300 ms como dice el paper, y calcula cinco distancias de Mahalanobis unidimensionales al cuadrado, no una única distancia en cinco dimensiones ni un promedio de desviaciones estándar. Además, los datos humanos completos y la referencia de 50.500 no están publicados: solo aparece un subconjunto de 4.500. La evidencia sí muestra que los modelos producen distribuciones de respuestas muy diferentes bajo estos prompts y que GPT-4 es el más cercano a los prototipos según las métricas elegidas. No demuestra personalidad humana, toma de decisiones realista, conducta estable ni NPC convincentes: el caso de juego es ilustrativo, sin jugadores, diálogo longitudinal ni evaluación conductual. La reproducibilidad queda debilitada por datos ausentes, rutas locales, resultados limpiados sin trazabilidad, un script que no compila, dependencias poco controladas y una credencial de API expuesta en el código, que debe revocarse y rotarse.

English

The paper proposes a benchmark for testing whether seven LLMs answer the IPIP-50 consistently with one of twenty target Big Five profiles, motivated by later use in video-game characters. It starts from 1,015,342 human questionnaires from the Open-Source Psychometrics Project; after requiring complete responses, a minimum response time, and the first submission per IP, the paper reports 596,956 cases. Five trait scores are normalized, each person is assigned by Euclidean distance to the nearest profile, and a balanced reference of 50,500 people, 2,525 per profile, is constructed. The twenty prototypes do not come from a taxonomy validated in the study; they are taken from a 2018 web page and include disorder-derived names and proposed opposites that function here only as non-diagnostic labels. For each profile, the prompt supplies the exact OCEAN vector and asks the model to answer all 50 items separately on a 1–5 Likert scale. The main table reports nearest-centroid accuracies of 5.00% for Flan-T5-XL, 5.00% for Flan-T5-XXL, 15.10% for text-davinci-003, 31.90% for GPT-3.5, 74.00% for GPT-4, 7.11% for Dolphin-2.7-Mixtral, and 6.33% for Mixtral-8x7B-Instruct. The 100% highlighted in the abstract is not global accuracy: Table 4 shows that, for particular profiles, every GPT-4 response lies inside the convex hull of the corresponding human cloud, which is a different metric. Auditing the GitLab artifact yields recomputed accuracies of approximately 5.00%, 5.00%, 15.08%, 31.90%, 71.64%, 7.11%, and 5.16%, so its GPT-4 and Mixtral figures do not match the paper. Artifact sample sizes also range from 3 to 64 or 128 repetitions per profile even though the paper states 64 for every model. The implementation filters human response times above 1,000 ms rather than the paper's 300 ms and computes five separate squared one-dimensional Mahalanobis distances, not one five-dimensional distance or an average number of standard deviations. The full human data and 50,500-person reference are not released; only a 4,500-person subset is present. The evidence does show substantial model differences under these prompts and that GPT-4 is closest to the chosen prototypes under the selected metrics. It does not establish human personality, realistic decision-making, stable behavior, or convincing NPCs: the game example is illustrative and includes no players, longitudinal dialogue, or behavioral evaluation. Reproducibility is further weakened by missing data, local paths, untraceable cleaned outputs, a script that fails to compile, weak dependency control, and an exposed API credential in the code that should be revoked and rotated.

Pregunta de investigación

¿Hasta qué punto distintos LLM, condicionados con vectores Big Five de veinte perfiles objetivo, responden los 50 ítems IPIP de manera comparable a distribuciones humanas asignadas a esos mismos perfiles, y puede ese procedimiento servir como benchmark inicial para diseñar NPC con personalidad?

Método

Estudio comparativo sin participantes nuevos. Los autores descargan 1.015.342 respuestas humanas al IPIP-50, aplican filtros de completitud, tiempo e IP, normalizan OCEAN y asignan cada caso al más cercano de veinte centroides fijos mediante distancia euclídea. Construyen una referencia equilibrada de 50.500 casos. Siete LLM reciben en cada prompt el vector numérico del perfil y un ítem IPIP aleatorizado; devuelven una opción Likert de 1 a 5. Las respuestas se puntúan con la clave IPIP y se comparan mediante clasificación al centroide, error cuadrático, pertenencia a la envolvente convexa humana y una implementación denominada Mahalanobis. El artefacto público y sus matrices NPY se auditan además para contrastar muestras, cifras, limpieza y reproducibilidad con el texto final.

Muestra: El artículo declara 1.015.342 cuestionarios humanos iniciales, 596.956 tras la limpieza y una muestra equilibrada final de 50.500, con 2.525 personas en cada uno de veinte perfiles. No se recogen participantes nuevos. El texto afirma 64 repeticiones sintéticas por perfil y modelo, equivalentes a 1.280 perfiles evaluados y 64.000 respuestas a ítems por modelo, pero los artefactos contienen 60 casos para Flan-XL, 1.280 para Flan-XXL, Dolphin y Mixtral, 2.560 para Davinci y GPT-4, y 2.558 para GPT-3.5. Solo se publica un subconjunto humano de 4.500 casos, no las tres muestras humanas declaradas.

Hallazgos

  • El estudio evalúa respuestas sintéticas a cuestionarios bajo un perfil impuesto; no observa una personalidad espontánea del modelo.
  • Los 1.015.342 cuestionarios proceden de un dataset público preexistente y no de participantes reclutados para este trabajo.
  • El texto declara 596.956 casos tras exigir los 50 ítems completos, aplicar un umbral temporal y conservar la primera respuesta por IP.
  • Cada respuesta humana se normaliza a cinco puntuaciones OCEAN entre cero y uno.
  • La etiqueta de perfil humano se obtiene asignando la puntuación al más cercano de veinte centroides por distancia euclídea.
  • El baseline equilibra artificialmente las clases con 2.525 casos por perfil, hasta 50.500.
  • Los veinte centroides se toman de una página web de 2018 y sus valores no se estiman ni validan con el dataset de este estudio.
  • Los nombres de varios perfiles proceden de terminología de trastornos de personalidad, pero el experimento los usa como etiquetas geométricas, no como diagnósticos.
  • El prompt comunica al LLM el vector OCEAN exacto del perfil antes de cada ítem.
  • Los 50 ítems se preguntan por separado, con orden aleatorio y una respuesta Likert cerrada de 1 a 5.
  • La tarea de exactitud comprueba si la puntuación sintética vuelve al mismo centroide que se suministró en el prompt.
  • La Tabla 2 publica 5,00 % de exactitud para Flan-T5-XL y 5,00 % para Flan-T5-XXL.
  • La Tabla 2 publica 15,10 % para text-davinci-003 y 31,90 % para GPT-3.5.
  • La Tabla 2 publica 74,00 % para GPT-4, el mejor resultado de la comparación principal.
  • La Tabla 2 publica 7,11 % para Dolphin-2.7-Mixtral y 6,33 % para Mixtral-8x7B-Instruct.
  • Las bandas que acompañan a las exactitudes se describen como intervalos del 95 %, pero el artículo no proporciona su fórmula ni unidad de remuestreo.
  • La inclusión en la envolvente convexa de la Tabla 4 es una métrica distinta de la clasificación al centroide de la Tabla 2.
  • GPT-4 alcanza 1,000 de inclusión convexa para Pronoid y People person, no 100 % de exactitud global.
  • El promedio de los veinte valores GPT-4 de la Tabla 4 es aproximadamente 0,729, coherente con un patrón fuerte pero no perfecto.
  • Los Flan no colocan puntos dentro de la envolvente humana en la mayoría de perfiles y solo recuperan un perfil en la clasificación global.
  • El repositorio permite recomputar 5,00 %, 5,00 %, 15,08 %, 31,90 %, 71,64 %, 7,11 % y 5,16 % para los siete artefactos comparables.
  • Los resultados recomputados de GPT-4 y Mixtral difieren materialmente del 74,00 % y 6,33 % publicados; los demás coinciden por redondeo.
  • Los artefactos de Flan-XL contienen solo tres casos por perfil, no las 64 repeticiones afirmadas.
  • Davinci y GPT-4 contienen 128 casos por perfil; GPT-3.5 casi 128, con dos filas ausentes.
  • La implementación filtra tiempos de respuesta humana de hasta 1.000 ms, mientras que el artículo dice eliminar tiempos inferiores a 300 ms.
  • El código R calcula Mahalanobis rasgo por rasgo con entradas unidimensionales y promedia resultados al cuadrado.
  • Por ello la Tabla 5 no representa la distancia de Mahalanobis conjunta en cinco dimensiones que describe la prosa.
  • El paquete R devuelve distancia de Mahalanobis al cuadrado, por lo que tampoco equivale directamente a un número medio de desviaciones estándar.
  • Las matrices brutas de algunos modelos contienen ceros derivados de fallos de parseo; las variantes limpias los sustituyen o eliminan sin documentar el procedimiento en el artículo.
  • El ejemplo de videojuego ilustra cómo usar un vector de personalidad para prompting, pero no contiene un experimento con NPC, jugadores o comportamiento interactivo.
  • La evidencia comparativa favorece a GPT-4 dentro del benchmark definido, no una equivalencia general entre salidas de GPT-4 y personalidad humana.
  • El artículo final figura en AIIDE 2024, volumen 20(1), páginas 65-75, DOI 10.1609/aiide.v20i1.31867.

Limitaciones

  • La asignación humana y la evaluación sintética dependen de los mismos veinte centroides fijos, lo que introduce circularidad en la definición de éxito.
  • El modelo recibe exactamente el vector que debe recuperar; la tarea mide seguimiento de una condición numérica más que descubrimiento autónomo de una personalidad.
  • La fuente de los veinte perfiles es una página web no revisada por pares y el estudio no aporta validación psicométrica de la taxonomía.
  • Las etiquetas con nombres de trastornos pueden sugerir validez clínica o reforzar estereotipos aunque aquí solo representen vectores OCEAN.
  • No se demuestra que los supuestos perfiles opuestos sean constructos psicológicos válidos o simétricos.
  • El equilibrado a 2.525 casos por perfil elimina la prevalencia natural y puede ocultar que algunos centroides describen regiones mucho más frecuentes.
  • La distancia euclídea presupone escalas comparables, independencia y geometría esférica de los cinco rasgos sin justificar esos supuestos.
  • No se evalúa estabilidad de la etiqueta humana frente a centroides alternativos, escalado distinto o incertidumbre cerca de las fronteras.
  • Las respuestas IPIP son autoinformadas y online; no se aporta verificación de identidad, diagnóstico ni representatividad poblacional.
  • El filtrado por dirección IP puede eliminar convivientes o redes compartidas y no garantiza personas únicas.
  • El umbral temporal contradice el código: 300 ms en el artículo frente a 1.000 ms en la implementación.
  • No se publican los datos humanos brutos, el conjunto limpio de 596.956 ni el baseline de 50.500 usado en las tablas.
  • El único subconjunto humano público tiene 4.500 casos, menos de una décima parte del baseline declarado.
  • La afirmación de 64 repeticiones por modelo contradice tamaños públicos equivalentes a 3, 64 o 128 por perfil.
  • No se explica por qué Davinci, GPT-3.5 y GPT-4 tienen aproximadamente el doble de repeticiones que las descritas.
  • Las dos filas ausentes de GPT-3.5 exigen construir etiquetas por posición y truncarlas, una decisión no documentada.
  • No se especifican de forma completa temperatura, top-p, semillas, parámetros de decodificación ni reintentos para todos los proveedores.
  • Los modelos de API están fijados a versiones de 2023 y algunos ya no pueden consultarse, por lo que la regeneración exacta depende de los artefactos.
  • No se controla contaminación: los LLM podrían haber visto IPIP, explicaciones Big Five o incluso los vectores de perfiles durante entrenamiento.
  • Preguntar cada ítem en una llamada separada elimina contexto de cuestionario, memoria, fatiga e interdependencia entre respuestas.
  • Una escala Likert forzada mide cumplimiento de formato y no riqueza de diálogo, acción o decisión en un juego.
  • El parser busca fragmentos textuales de las opciones; una respuesta mal formada se convierte silenciosamente en cero.
  • Los ceros pueden interpolarse al extremo inferior en lugar de marcarse como error, alterando puntuaciones y perfiles.
  • Las variantes clean de Mistral, Dolphin y Mixtral no documentan qué respuestas se sustituyeron, con qué regla ni desde qué reintento.
  • Un artefacto Mistral bruto contiene casi todos ceros por fallos de formato y solo el resultado limpio se aproxima a la cifra presentada.
  • Las diferencias GPT-4 y Mixtral entre tabla y artefacto no tienen una explicación o script de generación trazable.
  • El artículo afirma que 64 repeticiones garantizan significación estadística, pero el tamaño por sí solo no garantiza significación ni validez.
  • No se define cómo se calcularon los intervalos de confianza de la Tabla 2 ni si la unidad es perfil, repetición o ítem.
  • No se ajusta por comparaciones múltiples entre siete modelos, veinte perfiles, cinco rasgos y varias métricas.
  • La envolvente convexa es muy sensible al tamaño, dimensionalidad y dispersión de la muestra humana equilibrada.
  • Pertenecer a una envolvente convexa amplia no implica alta densidad, parecido individual ni plausibilidad psicológica.
  • La Tabla 3 denomina MSPE a una medida basada en distancia euclídea sin ofrecer una derivación suficiente para reproducirla desde el texto.
  • La implementación de Mahalanobis no coincide con la descripción conjunta en cinco dimensiones.
  • La salida de R es distancia cuadrática y no puede interpretarse directamente como promedio de desviaciones estándar.
  • La visualización PCA del notebook final se ajusta sobre datos sintéticos de GPT-4 tras sobrescribir la variable humana.
  • Esa PCA se aplica después a los demás modelos y puede favorecer visualmente la estructura de GPT-4 frente a la referencia humana esperada.
  • La partición usada para PCA no fija random_state, por lo que las figuras no son deterministas.
  • La tabla de exactitud del notebook está escrita manualmente en Markdown, no calculada en la ejecución mostrada.
  • El repositorio contiene rutas absolutas de Windows y referencias a ficheros ausentes, por lo que no se ejecuta de extremo a extremo en otro entorno.
  • No hay README raíz, licencia, pruebas automatizadas ni integración continua que expliquen o verifiquen el artefacto.
  • Un archivo Python contiene sintaxis inválida y compileall falla, además de advertencias por rutas con escapes inválidos.
  • requirements.txt carece de versiones para la mayoría de paquetes, duplica dependencias y conserva una API antigua de OpenAI.
  • El repositorio mezcla archivos del IDE, estado de R, cachés, binarios, PDFs y resultados, sin una separación reproducible entre fuente y artefactos.
  • Existe una credencial de OpenAI con apariencia activa escrita directamente en el código; debe revocarse, rotarse y retirarse también del historial.
  • No se documentan consentimiento, privacidad ni las implicaciones de agrupar respuestas por IP y reutilizar datos psicométricos.
  • No se evalúan diferencias demográficas, culturales, lingüísticas o de accesibilidad en la muestra humana.
  • El estudio se limita a IPIP-50 y no contrasta instrumentos más largos, entrevistas, observadores o conducta real.
  • No hay evaluación humana por psicólogos, diseñadores de juegos o jugadores.
  • No se prueba consistencia a lo largo de múltiples turnos, sesiones, recuerdos o cambios de contexto.
  • El prototipo de NPC es una demostración conceptual sin medidas de inmersión, engagement, credibilidad, seguridad o diversión.

Qué no demuestra

  • No demuestra que un LLM tenga personalidad, emociones, intenciones, identidad o experiencia subjetiva.
  • No demuestra que responder como un perfil IPIP equivalga a tomar decisiones humanas realistas.
  • No establece que los veinte perfiles sean una taxonomía psicológica válida.
  • No convierte las etiquetas con nombres clínicos en diagnósticos de personas o modelos.
  • No demuestra que GPT-4 alcance 100 % de exactitud global; la cifra máxima es específica de perfiles y de la envolvente convexa.
  • No prueba que todas las respuestas de GPT-4 sean indistinguibles de respuestas humanas.
  • No prueba que un punto dentro de la envolvente convexa sea probable, típico o individualmente humano.
  • No establece que 74 % sea reproducible con el artefacto público, que arroja aproximadamente 71,64 %.
  • No establece el 6,33 % de Mixtral a partir del artefacto comparable, que produce aproximadamente 5,16 %.
  • No demuestra significación estadística solo por repetir prompts 64 veces.
  • No permite interpretar la Tabla 5 como distancia Mahalanobis conjunta de cinco rasgos.
  • No permite interpretar sus valores como número medio de desviaciones estándar.
  • No demuestra que las diferencias entre modelos se deban únicamente a tamaño o a ser locales frente a modelos de frontera.
  • No separa capacidad de seguir instrucciones, conocimiento del test, formato de respuesta y representación de personalidad.
  • No demuestra robustez a prompts alternativos, idiomas, orden de preguntas o escalas distintas.
  • No demuestra generalización a HEXACO, MBTI, IPIP-120, IPIP-300, emoción u otros constructos.
  • No demuestra consistencia de personalidad en una conversación prolongada.
  • No demuestra transferencia desde respuestas de cuestionario a acciones, decisiones o relaciones sociales de un NPC.
  • No demuestra que los personajes resultantes mejoren la inmersión o el engagement de jugadores.
  • No evalúa seguridad, toxicidad, sesgos o estereotipos inducidos por los perfiles.
  • No proporciona un paquete reproducible que regenere desde cero las tablas publicadas.
  • No justifica usar el benchmark como validación clínica, selección de personas o inferencia de personalidad real.

Trazabilidad

Alcance: Texto completo

Versión: AIIDE 2024 final proceedings paper, volume 20 issue 1, pp. 65-75, DOI 10.1609/aiide.v20i1.31867, 11 pages; code artifact commit 143dc5f71b81ff0a2746befd87d400909ec6f624

Fuente consultada: https://ojs.aaai.org/index.php/AIIDE/article/download/31867/34034

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, psychometric, statistical, artifact-reproduction, code-quality, security, privacy and claim-scope audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Flan-T5-XL
  • Flan-T5-XXL
  • text-davinci-003
  • GPT-3.5 Turbo (gpt-3.5-turbo-0613)
  • GPT-4 (gpt-4-0613)
  • Dolphin 2.7 Mixtral
  • Mixtral 8x7B Instruct

Instrumentos y métricas

  • International Personality Item Pool Big-Five Factor Markers (IPIP-50)
  • Cinco Grandes / OCEAN normalizados a [0,1]
  • Veinte perfiles prototipo atribuidos a Van Mensvoort (2018)
  • Asignación al centroide más cercano por distancia euclídea
  • Exactitud de recuperación del perfil objetivo
  • Mean Squared Prediction Error (MSPE)
  • Inclusión en la envolvente convexa de datos humanos
  • Distancias denominadas Mahalanobis en el artículo
  • PCA para visualización

Datos utilizados

  • Open-Source Psychometrics Project IPIP Big-Five Factor Markers responses: 1.015.342 registros iniciales
  • Conjunto humano filtrado declarado: 596.956 respuestas completas
  • Baseline humano equilibrado declarado: 50.500 casos, 2.525 por perfil
  • Subconjunto público clean_subset_225: 4.500 casos, 225 por perfil
  • Matrices NPY de respuestas y evaluaciones sintéticas del repositorio GitLab humin-game-lab/llm-personality

Evidencia y localización

  • Registro bibliográfico oficial: AAAI AIIDE article 31867: Lawrence J. Klinkert, Steph Buongiorno and Corey Clark; volume 20(1), pp. 65-75; DOI 10.1609/aiide.v20i1.31867; published 15 Nov 2024
  • Fuente completa auditada: .cache/editorial-sources/article-093/source.pdf; official AIIDE 2024 PDF; 11 pages; sha256 469f46e154a9c6454ec48643d35b6f21069586986b0900c19b65e5c1428605f9
  • Objetivo, alcance y conclusión declarada: Full text pp. 65-66, Abstract and Introduction
  • Origen y limpieza del conjunto humano: Full text pp. 68-69, Human Baseline; 1,015,342 initial and 596,956 retained records
  • Discrepancia de umbral temporal: Full text p. 68 states 300 ms; GitLab commit 143dc5f, fall_23/scripts/main_zoo.py lines 88-103 applies 1,000 ms
  • Normalización y asignación a perfiles: Full text pp. 67-69, Personality Representation and Human Baseline
  • Procedencia de los veinte prototipos: Full text p. 67, Figure 1 and citation Mensvoort 2018; GitLab notebook_commons.py lines 372-392 contains fixed OCEAN vectors
  • Baseline equilibrado de 50.500: Full text p. 69, Human Baseline and Table 1; 2,525 cases for each of 20 profiles
  • Diseño del prompt y escala Likert: Full text pp. 69-70, Generate Synthetic Data and displayed Laissez-faire prompt
  • Repetición declarada de 64 veces: Full text p. 70, Generate Synthetic Data
  • Exactitud por modelo publicada: Full text p. 69, Table 2: 5.00, 5.00, 15.10, 31.90, 74.00, 7.11 and 6.33 percent
  • Definición de clasificación al perfil: Full text pp. 70-71, Synthetic Data and Personality Labels
  • MSPE y resultados por rasgo: Full text pp. 69-71, Table 3 and Results
  • Envolvente convexa como métrica separada: Full text pp. 71-72, Synthetic Data and Human Data and Table 4
  • Casos concretos de inclusión 100 %: Full text p. 71, Table 4: GPT-4 equals 1.0000 for Pronoid and People person
  • Descripción publicada de Mahalanobis: Full text pp. 72-73, paragraph before Table 5 and Table 5 caption
  • Implementación real de Mahalanobis: GitLab commit 143dc5f, fall_23/r/r_llm_personality/test.R lines 1022-1070: separate R mahalanobis calls for O, C, E, A and N
  • Caso de uso de videojuego solo ilustrativo: Full text pp. 73-74, LLM and Personality Use Case and Figures 4-5
  • Limitaciones reconocidas por los autores: Full text p. 74, Limitations
  • Conclusión y alcance propuesto: Full text pp. 74-75, Conclusion
  • Artefacto de código auditado: GitLab humin-game-lab/llm-personality, sole commit 143dc5f71b81ff0a2746befd87d400909ec6f624 dated 6 Sep 2024
  • Tamaños sintéticos públicos: GitLab NPY artifacts: n=60 Flan-XL; 1,280 Flan-XXL, Dolphin and Mixtral; 2,560 Davinci and GPT-4; 2,558 GPT-3.5
  • Exactitudes recomputadas desde artefactos: Nearest-centroid recomputation over public evaluation matrices: .0500, .0500, .15078125, .318999, .71640625, .07109375 and .0515625
  • Datos humanos ausentes: GitLab tree lacks data-final-commas.csv, clean_set, the 596,956-case clean data and 50,500-case baseline; only clean_subset_225 with 4,500 rows is present
  • Parseo y tratamiento silencioso de fallos: GitLab commit 143dc5f, fall_23/scripts/main_zoo.py lines 325-343 and TraitBasedPersonalityTest interpolation path
  • Resultados brutos y limpios sin trazabilidad: GitLab result directories include raw and _clean arrays; raw Dolphin and Mixtral contain about 4.6% zero responses and raw Mistral about 99.8%
  • PCA ajustada sobre GPT-4: GitLab final-report notebook code overwrites the human object with GPT-4 data before train_test_split and PCA fit; split has no fixed random_state
  • Portabilidad y fallo de compilación: GitLab repository uses hard-coded Windows paths; python -m compileall fails at fall_23/scripts/test_file.py line 3
  • Ausencia de empaquetado reproducible: GitLab root has no README, LICENSE, CI or tests; requirements.txt is largely unpinned, duplicates langchain and pins legacy openai 0.28
  • Credencial expuesta: GitLab commit 143dc5f, fall_23/scripts/notebook_commons.py lines 491-492 contains a hard-coded OpenAI credential and organization identifier; secret value intentionally omitted
  • Lectura y comprobación visual integral: All 11 pages rendered and inspected, including Figures 1-5, Tables 1-5, prompts, limitations, conclusion and references; checked 15 Jul 2026