PersonaLLM: Investigating the Ability of Large Language Models to Express Personality Traits

Personas, identidad y agentes2024ACL AnthologyRevisión editorial aprobada

Autores: Hang Jiang, Xiajie Zhang, Xubo Cao, Cynthia Breazeal, Deb Roy, Jad Kabbara

Palabras clave: LLM personas, Big Five personality model, personality expression, text generation, psycholinguistic patterns, human evaluation, personalized chatbots

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
25
Hallazgos
46
Limitaciones
19
Evidencias

Resumen editorial

Español

PersonaLLM estudia si GPT-3.5-turbo-0613, GPT-4-0613 y, en apéndices, LLaMA 2 70B expresan cinco rasgos Big Five impuestos por prompt. Los autores construyen las 32 combinaciones binarias de extroversión/introversión, amabilidad/antagonismo, responsabilidad/falta de responsabilidad, neuroticismo/estabilidad emocional y apertura/cierre a la experiencia. Para cada combinación generan diez personas por modelo: cada una recibe los adjetivos explícitos en el system prompt, completa el BFI de 44 ítems y, conservando ese intercambio en el contexto, escribe una historia personal de unas 800 palabras sin nombrar los rasgos. Los BFI de GPT-3.5 y GPT-4 separan todos los polos con p<.001 y tamaños de efecto muy grandes; en GPT-4, d va de 4,22 a 6,30. Esto demuestra fuerte cumplimiento del prompt y del autoinforme esperado, no personalidad interna ni validez psicométrica en LLM. El análisis LIWC-22 correlaciona 81 categorías con las etiquetas binarias y compara los signos significativos con 2.467 ensayos humanos del corpus Essays. GPT-4 comparte más asociaciones con humanos que GPT-3.5 en responsabilidad y apertura, pero las tareas humanas y sintéticas no usan el mismo prompt y se ejecutan cientos de pruebas sin corrección por multiplicidad publicada. Para la evaluación humana se descartan historias que contienen lexemas explícitos de personalidad: el filtro elimina el 96,56 % de las historias GPT-3.5 y el 31,87 % de las GPT-4, por lo que solo se estudian 32 historias GPT-4 seleccionadas, una por perfil. Treinta y nueve trabajadores estadounidenses de Prolific, anglófonos y pagados a 15 dólares/hora, valoran historias en condiciones informada y no informada sobre la autoría de IA. Cada historia recibe cinco valoraciones por condición sobre seis cualidades y cinco rasgos. Al agregar por mayoría, el grupo no informado acierta extroversión en 0,84 y amabilidad en 0,69; las demás quedan entre 0,56 y 0,59. Informar de la autoría reduce esas cifras a 0,72, 0,53, 0,53, 0,41 y 0,53, respectivamente. Sin embargo, el acuerdo entre anotadores es casi nulo: los alfa de Krippendorff de personalidad van aproximadamente de -0,03 a 0,12, de modo que la mayoría estabiliza votos muy discordantes. GPT-4 como evaluador muestra además preferencia extrema por historias GPT-4, con puntuaciones casi perfectas y varianza mínima. El trabajo aporta evidencia valiosa de que prompts binarios extremos dejan señales lingüísticas reconocibles, sobre todo para extroversión, y de que revelar autoría cambia la atribución humana; no prueba que todas las personalidades sean perceptibles de forma robusta ni que las historias modelen personas humanas. El repositorio oficial conserva 320 BFI y 320 historias por modelo, textos y resultados LIWC, pero la auditoría de la rama v2.0 no encontró las anotaciones humanas prometidas ni un manifiesto de dependencias. También detectó discrepancias entre método y código: el paper dice paired t-tests, mientras el script elige ANOVA o Mann–Whitney; y el generador publicado recorre las combinaciones desde el índice 14, por lo que no reconstruye una ejecución completa sin modificación.

English

PersonaLLM studies whether GPT-3.5-turbo-0613, GPT-4-0613, and, in appendices, LLaMA 2 70B express five prompt-assigned Big Five traits. The authors construct all 32 binary combinations of extroverted/introverted, agreeable/antagonistic, conscientious/unconscientious, neurotic/emotionally stable, and open/closed to experience. They generate ten personas per combination and model: each receives the explicit adjectives in its system prompt, completes the 44-item BFI, and, with that exchange retained in context, writes an approximately 800-word personal story without naming the traits. GPT-3.5 and GPT-4 BFI scores separate every assigned pole at p<.001 with very large effect sizes; for GPT-4, d ranges from 4.22 to 6.30. This establishes strong prompt and expected-self-report compliance, not internal personality or psychometric validity for LLMs. The LIWC-22 analysis correlates 81 categories with binary assignments and compares significant directions with 2,467 human Essays-corpus texts. GPT-4 shares more human associations than GPT-3.5 for conscientiousness and openness, but the human and synthetic tasks use different prompts and hundreds of tests are run without a reported multiplicity correction. Human evaluation excludes stories containing explicit personality lexemes: the filter removes 96.56% of GPT-3.5 stories and 31.87% of GPT-4 stories, leaving only 32 selected GPT-4 stories, one per profile. Thirty-nine US-based, English-first-language Prolific workers, paid $15/hour, rate stories under informed and uninformed AI-authorship conditions. Each story receives five ratings per condition on six qualities and five traits. Under majority vote, the uninformed group identifies extraversion at 0.84 and agreeableness at 0.69; the other traits range from 0.56 to 0.59. Informing raters of AI authorship lowers these figures to 0.72, 0.53, 0.53, 0.41, and 0.53, respectively. Inter-rater agreement is nevertheless nearly absent: personality Krippendorff alpha values run roughly from -0.03 to 0.12, so majority vote stabilizes highly discordant judgments. GPT-4 as a judge also strongly favors GPT-4 stories, assigning near-perfect scores with minimal variance. The paper provides useful evidence that extreme binary prompts leave recognizable linguistic signals, especially for extraversion, and that authorship disclosure changes human attribution; it does not show that all traits are robustly perceptible or that the stories model human people. The official repository preserves 320 BFI outputs and 320 stories per model, texts, and LIWC results, but an audit of branch v2.0 found neither the promised human annotations nor a dependency manifest. It also found method-code discrepancies: the paper says paired t-tests, whereas the script selects ANOVA or Mann-Whitney; and the published story generator iterates from personality combination index 14, so it cannot reconstruct a clean full run without modification.

Pregunta de investigación

¿Hasta qué punto LLM condicionados con las 32 combinaciones binarias del Big Five producen autoinformes BFI y relatos coherentes con el perfil asignado; qué patrones LIWC aparecen frente a escritura humana; cómo valoran humanos y LLM esos relatos; y pueden inferir sus rasgos, con o sin conocer la autoría de IA?

Método

Para GPT-3.5, GPT-4 y LLaMA 2 se cruzan cinco pares de adjetivos Big Five en 32 perfiles y se generan diez réplicas por perfil a temperatura 0,7. Cada persona completa el BFI de 44 ítems y después escribe una historia personal de 800 palabras dentro del mismo historial conversacional. Se calculan puntuaciones BFI por rasgo y diferencias entre polos con pruebas de medias y d de Cohen. LIWC-22 extrae 81 categorías psicológicas y de vocabulario extendido de 320 relatos por modelo; se usan correlaciones punto-biseriales con la etiqueta asignada y Spearman con la puntuación BFI, comparadas con 2.467 ensayos humanos. Un filtro lexicográfico excluye menciones explícitas de rasgos y se toma una historia GPT-4 por cada uno de los 32 perfiles. En Prolific, cinco evaluadores por historia y condición califican seis propiedades narrativas y cinco rasgos en Likert 1-5; otra condición revela la autoría de IA. Se calcula exactitud individual y por voto mayoritario, correlación de Spearman con BFI y alfa de Krippendorff. GPT-3.5 y GPT-4 realizan evaluaciones paralelas a temperatura 0, con cinco repeticiones.

Muestra: El núcleo generativo contiene 32 perfiles factoriales binarios y diez réplicas por modelo. Los análisis principales usan 320 GPT-3.5 y 320 GPT-4; LLaMA 2 aparece en apéndices. La evaluación humana usa únicamente 32 relatos GPT-4 que sobreviven a un filtro de palabras y representan uno por perfil, con 16 etiquetas positivas y 16 negativas por rasgo. Participan 39 trabajadores de Prolific residentes en Estados Unidos, con inglés como primera lengua y aprobación del 99-100 %; 37 nacieron en EE. UU. y dos en Nigeria. Las historias se dividen en cuatro lotes de ocho y cada una recibe cinco valoraciones por condición. No se estudian conversaciones, usuarios de chatbots ni conductas humanas simuladas fuera de una tarea escrita.

Hallazgos

  • El system prompt enumera directamente cinco adjetivos, uno por dimensión, y cubre las 32 combinaciones binarias posibles.
  • Cada historia se genera después de que la misma persona haya contestado el BFI; el código conserva preguntas y respuestas BFI en el contexto del relato.
  • En GPT-3.5, los d de Cohen entre polos BFI son 7,81, 5,93, 1,56, 1,83 y 2,90 para extraversión, amabilidad, responsabilidad, neuroticismo y apertura.
  • En GPT-4, los d correspondientes son 5,47, 4,22, 4,39, 5,17 y 6,30, todos con p<.001 según el paper.
  • LLaMA 2 también separa todos los polos en BFI, pero con efectos menores, de d=1,16 a 2,86.
  • El BFI mide respuestas condicionadas por etiquetas explícitas y no constituye una prueba independiente de rasgos latentes.
  • Las etiquetas asignadas correlacionan con categorías LIWC estereotípicas: extroversión con tono positivo y afiliación; neuroticismo con ansiedad, tono negativo y salud mental; apertura con curiosidad.
  • GPT-4 comparte con el corpus humano 11 de 31 asociaciones significativas de responsabilidad y 17 de 36 de apertura; GPT-3.5 comparte 1 de 31 y 2 de 36, respectivamente.
  • Algunas asociaciones divergen de humanos: la escritura responsable del LLM se vincula con logro cuando la humana no, y tristeza se correlaciona negativamente con neuroticismo en GPT-3.5 pero positivamente en GPT-4 y humanos.
  • El análisis LIWC usa tareas de escritura no equivalentes y trata el corpus humano como referencia aproximada, una cautela reconocida por los autores.
  • El 96,56 % de las historias GPT-3.5 y el 31,87 % de las GPT-4 contienen alguna mención lexicográfica explícita de los rasgos pese a la prohibición.
  • Debido a ese fallo de instrucción y al presupuesto, la evaluación humana se limita a 32 historias GPT-4 filtradas.
  • Los humanos puntúan las historias cerca o por encima de 4 en legibilidad, cohesión, credibilidad y carácter personal, con agrado algo menor.
  • Cuando se revela autoría de IA, el promedio humano de carácter personal baja de 4,32 a 3,99; las demás dimensiones narrativas cambian poco.
  • GPT-4 evaluador da 4,84-5,00 en casi todas las cualidades y desviaciones muy pequeñas, una preferencia hacia contenido GPT-4 que el propio artículo reconoce.
  • En predicción individual no informada, humanos alcanzan 0,68 en extraversión, 0,51 en amabilidad y 0,41-0,47 en los otros tres rasgos.
  • Con voto mayoritario no informado, la exactitud humana es 0,84, 0,69, 0,59, 0,59 y 0,56 para extraversión, amabilidad, responsabilidad, neuroticismo y apertura.
  • Con autoría revelada, el voto humano baja a 0,72, 0,53, 0,53, 0,41 y 0,53.
  • GPT-4 predice extraversión con 0,97 y amabilidad y responsabilidad con aproximadamente 0,68-0,69; neuroticismo y apertura quedan alrededor de 0,56-0,59.
  • En condición no informada, percepción humana y BFI de la persona correlacionan r=.64, .33, .26, .23 y .22; informada, r=.42, .32, .20 y .17, mientras apertura deja de ser significativa.
  • El acuerdo humano es extremadamente bajo: para las seis cualidades alfa va de aproximadamente -0,04 a 0,11 y para personalidad de -0,03 a 0,12.
  • Los comentarios informados tienen sentimiento medio 0,45 frente a 0,16 en no informados según el clasificador automático, aunque no se informa prueba de esa diferencia.
  • El estudio recibió estatus exento del IRB, informa consentimiento, no recoge identificadores y paga 15 dólares por hora.
  • El repositorio oficial publica 320 BFI y 320 historias por cada uno de los tres modelos, junto con textos, puntuaciones y resultados LIWC.
  • La rama oficial v2.0 auditada no contiene las anotaciones humanas o comentarios prometidos en el apéndice, ni un entorno de dependencias versionado.

Limitaciones

  • El estudio mide expresión y cumplimiento de prompts de personalidad, no posesión de rasgos psicológicos por el modelo.
  • Los cinco rasgos continuos se reducen a adjetivos binarios extremos y se pierde toda gradación, incertidumbre y contexto.
  • Algunos polos tienen carga moral o normativa, como agreeable/antagonistic y conscientious/unconscientious.
  • El BFI se administra inmediatamente después de revelar al modelo las etiquetas que determinan las respuestas esperables.
  • El relato conserva en el contexto las 44 respuestas BFI previas, por lo que las señales narrativas no proceden solo del system prompt y la tarea no es independiente.
  • Los tamaños de efecto enormes pueden reflejar demanda experimental y cumplimiento literal, no una estructura psicológica estable.
  • No se prueba consistencia test-retest con prompts nuevos, contextos distractores, conversaciones largas o tareas no relacionadas.
  • No hay condición sin BFI previo, sin etiquetas explícitas, con descripciones conductuales equivalentes o con perfiles continuos.
  • El paper afirma paired t-tests, pero el código oficial auditado aplica un test de normalidad y después ANOVA de una vía o Mann–Whitney, sin emparejar las réplicas factoriales.
  • No se informa corrección por las cinco pruebas BFI, aunque los p<.001 y efectos grandes reducen la relevancia práctica de esa omisión en ese bloque.
  • LIWC evalúa 81 variables por cinco rasgos y varios corpus con umbral p<=.05; el paper y los scripts no aplican corrección por cientos de comparaciones.
  • Sin corrección, parte de los solapamientos de asociaciones significativas puede surgir por falsos positivos.
  • Contar coincidencias significativas no mide acuerdo de magnitud, estabilidad ni equivalencia de distribuciones entre humanos y LLM.
  • El corpus Essays usa stream-of-consciousness humano y las personas LLM escriben historias personales de 800 palabras; longitud, época, tema y prompt difieren.
  • Las etiquetas humanas del Essays son autoinformes binarizados, mientras las del LLM son asignaciones experimentales explícitas.
  • LIWC es propietario y el repositorio publica resultados derivados, no un flujo autónomo que pueda ejecutarse sin licencia.
  • El filtro de menciones explícitas solo busca raíces concretas y puede dejar sinónimos, paráfrasis o descripciones estereotípicas igualmente transparentes.
  • La selección posterior al resultado excluye el 96,56 % de GPT-3.5 y casi un tercio de GPT-4, favoreciendo las historias que obedecen mejor y alterando la población evaluada.
  • La evaluación humana no incluye GPT-3.5 ni LLaMA 2, por lo que no permite comparar percepción humana entre modelos.
  • Solo se evalúa una historia por perfil; efectos de historia, tema y combinación quedan confundidos con el rasgo.
  • No se publica semilla ni regla de selección entre las historias elegibles de cada perfil.
  • Treinta y dos historias implican incrementos de exactitud de 1/32=0,03125, por lo que cifras como 0,84 tienen resolución gruesa e intervalos amplios no reportados.
  • El máximo de hasta 80 % corresponde a voto mayoritario para extraversión en un subconjunto filtrado, no a exactitud general por persona ni por los cinco rasgos.
  • El artículo califica la caída al revelar autoría como significativa, pero no publica una prueba directa ni intervalo para la diferencia de exactitudes.
  • Los evaluadores informados y no informados pueden diferir por composición; no se presenta un modelo que controle historia, participante o lote.
  • El acuerdo casi nulo o negativo muestra que la percepción individual es inestable y limita la interpretación del voto mayoritario como consenso.
  • Cinco votos por historia son pocos para estimar una mayoría robusta cuando las etiquetas Likert incluyen una categoría neutral.
  • Convertir 1-2 en negativo, 3 en neutral y 4-5 en positivo y luego evaluar contra una etiqueta binaria no explica con claridad cómo se trata neutral en exactitud.
  • La exactitud contra 0,5 ignora posibles respuestas neutrales y no se acompaña de sensibilidad, especificidad, matriz de confusión o calibración.
  • Las múltiples correlaciones percepción-BFI no documentan corrección por multiplicidad ni intervalos.
  • Las puntuaciones BFI y los relatos provienen del mismo contexto, de modo que su correlación no valida dos medidas independientes.
  • La muestra humana se limita a residentes estadounidenses anglófonos con alta aprobación en Prolific; 37 de 39 nacieron en EE. UU.
  • No se analiza el efecto de edad, sexo, etnia o personalidad del anotador pese a mostrar sus distribuciones.
  • Cinco repeticiones del mismo LLM evaluador a temperatura 0 no son jueces independientes y producen varianza artificialmente baja.
  • GPT-4 evalúa historias GPT-4 y muestra puntuaciones de 5,00 con desviación cero, por lo que no puede sustituir una evaluación humana imparcial.
  • La diferencia de sentimiento de comentarios se resume con una media de etiquetas -1/0/1 sin validación humana ni prueba estadística.
  • LLaMA 2 fue excluido de evaluación humana por repetición y menciones explícitas, lo que crea selección por rendimiento del modelo.
  • Solo se estudian modelos y endpoints de 2023, una tarea de escritura en inglés y rasgos Big Five; no hay diálogo, planificación o comportamiento real.
  • Los endpoints GPT-3.5-turbo-0613 y GPT-4-0613 ya no ofrecen una superficie estable para una réplica contemporánea idéntica.
  • El repositorio no contiene requirements, environment, pyproject o lockfile, y usa una interfaz antigua de OpenAI sin versiones de librerías.
  • El script de historias publicado itera list(product(...))[14:], por lo que una ejecución desde cero omite los primeros 14 perfiles aunque las salidas completas sí estén versionadas.
  • El repositorio no incluye las anotaciones humanas, asignaciones por condición o comentarios que el paper declara que publicará, impidiendo recalcular tablas 2 y 5-7.
  • La licencia MIT del repositorio no aclara por sí sola los derechos de redistribución de Essays, LIWC ni otros artefactos de terceros incluidos o derivados.
  • No hay auditoría de estereotipos, toxicidad o daño producido por perfiles antagonistas, irresponsables, neuróticos o cerrados.
  • La evaluación de seguridad se limita a comprobar que las 32 historias seleccionadas no contengan texto dañino u ofensivo.
  • No hay usuarios de chatbots, interacciones repetidas, confianza, manipulación, dependencia emocional ni impacto social medido.

Qué no demuestra

  • No demuestra que GPT-3.5, GPT-4 o LLaMA 2 tengan una personalidad interna.
  • No demuestra que el BFI sea psicométricamente válido como autoinforme de un LLM instruido con el perfil esperado.
  • No demuestra estabilidad de rasgos fuera del contexto que contiene etiquetas y respuestas BFI.
  • No demuestra que las historias equivalgan a comportamiento humano o a agentes sociales realistas.
  • No demuestra equivalencia entre patrones LIWC de humanos y LLM; solo solapamiento parcial de asociaciones seleccionadas.
  • No demuestra que GPT-4 sea más humano en personalidad por compartir más correlaciones significativas.
  • No demuestra que el 80 % se aplique a los cinco rasgos, a evaluadores individuales o a historias no filtradas.
  • No demuestra percepción robusta de neuroticismo, apertura o responsabilidad a nivel individual.
  • No demuestra consenso humano, dado el alfa de Krippendorff cercano a cero.
  • No demuestra causalmente que informar de autoría reduzca la exactitud sin un análisis directo de diferencia y control por participantes.
  • No demuestra que revelar autoría empeore la valoración narrativa general; la mayor parte de las medias cambia poco.
  • No demuestra que las puntuaciones casi perfectas de GPT-4 evaluador sean válidas o imparciales.
  • No demuestra generalización a modelos actuales, otros prompts, idiomas, culturas, modalidades o tareas interactivas.
  • No demuestra que una personalidad inducida mejore personalización, utilidad, seguridad o bienestar de usuarios.
  • No permite reproducir íntegramente la evaluación humana desde el repositorio oficial auditado.
  • No permite ejecutar una réplica limpia contemporánea sin reconstruir dependencias, corregir el generador y sustituir endpoints retirados.
  • No establece que los riesgos de agentes personificados queden mitigados mediante divulgación de autoría por sí sola.

Trazabilidad

Alcance: Texto completo

Versión: Findings of NAACL 2024 final paper, pp. 3605-3627, DOI 10.18653/v1/2024.findings-naacl.229, 23 pages; official PersonaLLM repository v2.0 audited at commit 286c149fc52363127857ef2863091a4c377f065e

Fuente consultada: https://aclanthology.org/2024.findings-naacl.229.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, psychometric, LIWC, human-evaluation, inter-rater, multiple-testing, code-artifact, reproducibility, bias and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5-turbo-0613 como generador y evaluador
  • GPT-4-0613 como generador y evaluador
  • LLaMA 2 70B Chat mediante Replicate, revisión 2d19859030ff705a87c746f7e96eea03aefb71f166725aee39692f1476566d48
  • cardiffnlp/twitter-roberta-base-sentiment-latest para comentarios humanos
  • LIWC-22 como software de análisis léxico

Instrumentos y métricas

  • Big Five Inventory (BFI), 44 ítems y puntuación Likert 1-5
  • Cinco pares binarios de adjetivos Big Five definidos en el system prompt
  • Linguistic Inquiry and Word Count 2022 (LIWC-22), 81 métricas psicológicas y de vocabulario extendido
  • Seis escalas narrativas: legibilidad, carácter personal, redundancia, cohesión, agrado y credibilidad
  • Cinco escalas de personalidad percibida con descriptores de facetas
  • Filtro lexicográfico de menciones explícitas de personalidad
  • Exactitud individual y por voto mayoritario
  • Correlación punto-biserial y Spearman
  • d de Cohen y pruebas de diferencia entre polos
  • Alfa de Krippendorff para acuerdo entre anotadores
  • Clasificador de sentimiento RoBERTa para comentarios opcionales

Datos utilizados

  • 960 personas sintéticas: 320 por GPT-3.5, GPT-4 y LLaMA 2
  • 960 respuestas BFI, diez por cada una de las 32 combinaciones y modelo
  • 960 historias personales generadas, 320 por modelo
  • 32 historias GPT-4 filtradas, una por combinación, para evaluación humana y automática
  • Essays dataset: 2.467 ensayos stream-of-consciousness humanos de 1997-2004 con Big Five binario
  • Comentarios opcionales: 104 válidos en condición informada y 122 en condición no informada
  • Repositorio oficial con salidas, textos, puntuaciones BFI, resultados LIWC y scripts; sin fichero localizable de anotaciones humanas en la revisión auditada

Evidencia y localización

  • Registro bibliográfico y abstract oficial: ACL Anthology 2024.findings-naacl.229: 6 authors, Findings of NAACL 2024, pp. 3605-3627, DOI 10.18653/v1/2024.findings-naacl.229
  • Fuente completa auditada: .cache/editorial-sources/article-098/source.pdf; official ACL PDF; 23 pages; sha256 4aebad9530ccb1ab3a4efc6d9b52e774689dd23474101460718a22dd4511c56f
  • Preguntas de investigación y flujo: Full text pp. 3605-3606, Introduction, Figure 1 and RQ1-RQ4
  • Modelos, perfiles y prompts: Full text pp. 3606-3607, sections 2.1.1-2.1.4
  • BFI y tamaños de efecto: Full text p. 3608, Figure 2 and section 3.1; appendix p. 3625, Table 9
  • LIWC y comparación humana: Full text pp. 3607 and 3609-3610, sections 2.2.1 and 3.2, Table 1; appendix pp. 3625-3627
  • Filtro y selección de historias: Full text p. 3607, section 2.2; appendix pp. 3620-3621, section D.1
  • Diseño de evaluación humana y automática: Full text pp. 3608-3610, sections 2.2.2-2.3 and 3.3, Table 2
  • Exactitud individual y por mayoría: Full text pp. 3611-3612, section 3.4.1 and Figures 3-4
  • Correlaciones entre percepción y BFI: Full text p. 3611, section 3.4.2
  • Ejemplos y comentarios: Appendix pp. 3617-3620, Tables 3-4 and sections A-B
  • Acuerdo entre anotadores: Appendix pp. 3620-3623, Tables 6-7 and section D.3
  • Muestra y procedimiento Prolific: Appendix pp. 3621-3625, sections D.2-D.4 and Figures 5-18
  • Sesgo y temperatura de evaluadores LLM: Full text p. 3610, section 3.3; appendix p. 3625, Table 8
  • Limitaciones y ética reconocidas: Full text pp. 3613-3614, Limitations and Ethical Considerations
  • Repositorio oficial y salidas publicadas: Official https://github.com/hjian42/PersonaLLM branch v2.0, commit 286c149fc52363127857ef2863091a4c377f065e: 320 BFI and 320 writing outputs for each of GPT-3.5, GPT-4 and LLaMA 2
  • Discrepancia de pruebas estadísticas: Official repository run_llm_liwc_analysis.py at audited commit: personality_t_test selects scipy.stats.f_oneway or mannwhitneyu, while paper p. 3608 states paired t-tests
  • Limitaciones del código reproducible: Official repository at audited commit: no dependency manifest; run_creative_writing.py iterates product profiles with [14:]; no human annotation dataset or comments located
  • Comprobación visual integral: All 23 PDF pages rendered and visually inspected, including nine tables, eighteen figures, prompts, examples, human-study materials, demographics, limitations, ethics and appendices; checked 15 Jul 2026