Exploring the Potential of Large Language Models to Simulate Personality

Evaluación y validez psicométrica2025arXivRevisión editorial aprobada

Autores: Maria Molchanova, Anna Mikhailova, Anna Korzanova, Lidiia Ostyakova, Alexandra Dolidze

Palabras clave: personality simulation, conversational AI, Big Five model, dialogue personalization, personality-related text generation, LLM challenges, trait modeling

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
50
Hallazgos
157
Limitaciones
28
Evidencias

Resumen editorial

Español

Este estudio evalúa si GPT-3.5 Turbo, GPT-4o, Claude 3 Haiku y Mixtral 8x22B obedecen instrucciones de personalidad Big Five en dos tareas: responder los ítems del BFI-44 como si tuvieran un rasgo alto o bajo y redactar respuestas breves condicionadas por un rasgo y una puntuación de 1 a 5. La evaluación de texto combina 288 muestras revisadas por ocho anotadores, un clasificador GPT-4o calibrado contra esas etiquetas y análisis léxico con TF-IDF y spaCy. Los resultados respaldan una conclusión limitada: los modelos suelen obedecer mejor los extremos que el nivel medio, Openness es el rasgo más reconocible y Neuroticism el más difícil; además aparecen sesgos hacia alta Agreeableness y baja Neuroticism. El clasificador alcanza F1 ponderado de 0,87 a 0,63 al detectar presencia de rasgo y de 0,78 a 0,50 al clasificar nivel, con MAE de 0,44 a 1,77. Esto muestra control lingüístico parcial y desigual, no personalidad psicológica. La afirmación de que alfas superiores a 0,85 hacen respuestas reales y plausibles confunde consistencia interna con validez. El protocolo filtra los casos no distinguibles de sus matrices de confusión, edita manualmente respuestas de Claude y usa las mismas definiciones de rasgo para generar y clasificar. El repositorio abierto aporta parte del código, pero no contiene el dataset, las anotaciones ni los resultados prometidos, y su configuración no reproduce las cuatro temperaturas del artículo. El trabajo fue aceptado bajo el apartado archival de CustomNLP4U 2024, pero no tiene ficha individual ni DOI en los proceedings de ACL; la fuente citable comprobable es arXiv v1.

English

This study tests whether GPT-3.5 Turbo, GPT-4o, Claude 3 Haiku, and Mixtral 8x22B follow Big Five personality instructions in two tasks: answering BFI-44 items as if a trait were high or low, and writing short responses conditioned on one trait and a score from 1 to 5. Text evaluation combines 288 samples reviewed by eight annotators, a GPT-4o classifier calibrated against those labels, and lexical analyses with TF-IDF and spaCy. The results support a limited conclusion: models tend to express the extremes more clearly than the middle level, Openness is the most recognizable trait, and Neuroticism is the hardest; biases toward high Agreeableness and low Neuroticism also appear. The classifier's weighted F1 ranges from 0.87 to 0.63 for detecting trait presence and from 0.78 to 0.50 for classifying level, with MAE from 0.44 to 1.77. This is evidence of partial and uneven linguistic control, not psychological personality. The claim that alpha values above 0.85 make responses real and plausible confuses internal consistency with validity. The protocol removes nondistinguishable cases from confusion matrices, manually edits some Claude responses, and uses the same trait definitions for generation and classification. The open repository provides some code but not the promised dataset, annotations, or results, and its defaults do not reproduce the four temperatures reported in the paper. The work was accepted under the archival heading at CustomNLP4U 2024, but it has no individual ACL proceedings record or DOI; the verifiable citable source is arXiv v1.

Pregunta de investigación

¿Hasta qué punto cuatro LLM comerciales pueden obedecer instrucciones de rasgos Big Five de nivel alto, medio o bajo de forma consistente tanto en un cuestionario como en texto libre, y qué evaluación humana, automática y léxica permite medirlo?

Método

Primero se induce por separado un nivel alto o bajo de cada rasgo y cada modelo responde solo a los ítems correspondientes del BFI-44; se agregan puntuaciones y se informan alfa de Cronbach, lambda de Guttman y distribuciones por modelo y rasgo. Después, para seis preguntas abiertas, se generan textos para cada combinación de cuatro modelos, cuatro temperaturas (0, 0,5, 0,7 y 0,9), cinco rasgos y cinco puntuaciones discretas. Un subconjunto de unas 288 respuestas se reparte entre ocho anotadores, tres por texto, que puntúan de -2 a +2, eligen el tipo de evidencia y marcan expresiones relevantes; el acuerdo se calcula con kappa de Fleiss y las etiquetas finales por votación. GPT-4o clasifica automáticamente todo el corpus con un prompt inspirado en CARP y se compara con las etiquetas humanas en tres niveles. Las respuestas detectables se resumen en matrices de confusión; TF-IDF, vecinos próximos y lematización spaCy se usan para analizar separación léxica. La auditoría contrastó las cifras, figuras, prompts y afirmaciones del PDF con el repositorio público y con los registros oficiales de arXiv, CustomNLP4U y ACL Anthology.

Muestra: Se comparan cuatro LLM. En texto libre, el diseño descrito cruza 4 modelos por 4 temperaturas por 5 rasgos por 5 puntuaciones por 6 preguntas, lo que implica 2.400 respuestas esperadas; Figure 4 contabiliza 2.399 clasificadas o no distinguibles y deja una muestra de Claude-Openness sin explicar. Aproximadamente 288 textos, 12 % del total esperado, fueron anotados por ocho personas y cada texto recibió tres valoraciones. El artículo dice equilibrar ese subconjunto por modelo y temperatura, pero no documenta equilibrio por rasgo, puntuación o pregunta. Para perfiles multirrasgo se ajustan medias y varianzas a 1.015.342 respuestas humanas del Big Five Personality Test Dataset, aunque ese segundo conjunto se reserva para trabajo futuro y no entra en los resultados principales.

Hallazgos

  • Los cuatro modelos pueden cambiar parcialmente sus respuestas BFI-44 cuando se les ordena representar un rasgo alto o bajo.
  • Figure 1 muestra solapamiento frecuente entre condiciones alta y baja, de modo que ningún modelo separa de forma consistente los cinco rasgos.
  • Claude separa mejor Openness y Conscientiousness en el cuestionario según la interpretación de los autores.
  • Mixtral muestra la separación más clara para Agreeableness y Neuroticism en el cuestionario según los autores.
  • Los dos GPT distinguen mejor los extremos de Extraversion; GPT-4o también separa mejor Agreeableness.
  • La alfa de Cronbach informada va de 0,87 a 0,94 entre rasgos.
  • La lambda de Guttman informada va de 0,95 a 0,97.
  • Esos coeficientes indican consistencia de ítems bajo el protocolo, no que las respuestas sean reales ni psicológicamente válidas.
  • No se publica ninguna medida de validez pese a que el método dice medir fiabilidad y validez.
  • La generación de texto usa seis preguntas abiertas, cinco puntuaciones por rasgo y cuatro temperaturas.
  • El diseño factorial descrito implica 2.400 textos de un solo rasgo.
  • Figure 4 suma 2.399 casos, con 119 en Claude-Openness y 120 en cada una de las otras 19 combinaciones modelo-rasgo.
  • La única observación ausente no se explica.
  • El acuerdo humano de Level 1 oscila entre kappa 0,59 para Neuroticism y 0,71 para Agreeableness.
  • El acuerdo humano de Level 2 oscila entre 0,57 para Neuroticism y 0,70 para Agreeableness.
  • Estos valores reflejan acuerdo moderado, no una etiqueta psicológica inequívoca.
  • El clasificador GPT-4o obtiene F1 ponderado de Level 1: 0,87 en Openness, 0,80 en Conscientiousness, 0,76 en Extraversion, 0,71 en Agreeableness y 0,63 en Neuroticism.
  • En Level 2, el F1 baja a 0,78, 0,75, 0,65, 0,67 y 0,50 respectivamente.
  • El MAE de Level 3 es 0,44 en Openness, 1,05 en Conscientiousness, 0,88 en Extraversion, 0,54 en Agreeableness y 1,77 en Neuroticism.
  • Neuroticism es simultáneamente el rasgo con peor acuerdo humano y peor rendimiento del clasificador.
  • Las evaluaciones automáticas de Neuroticism son por tanto especialmente inciertas.
  • Figure 4 marca Openness como detectable en 116 de 119 textos Claude, 117 de 120 GPT-3.5, 107 de 120 GPT-4o y 107 de 120 Mixtral.
  • Para Neuroticism, la detectabilidad cae a 61 de 120 en Claude, 74 en GPT-3.5, 79 en GPT-4o y 72 en Mixtral.
  • Agreeableness es detectable en 110 de 120 textos Claude, 107 GPT-3.5, 107 GPT-4o y 108 Mixtral.
  • La detectabilidad alta de un rasgo no implica que el nivel solicitado se clasifique correctamente.
  • Las matrices de Figure 2 eliminan los textos que el clasificador llama Nondistinguishable.
  • Esa exclusión condiciona la aparente exactitud a los casos en que el evaluador automático ya encontró señal.
  • Los niveles medios se confunden con frecuencia con extremos altos o bajos.
  • Los autores concluyen que una codificación binaria puede ser más controlable que cinco niveles finos.
  • Openness es el rasgo más consistentemente expresado en el corpus según evaluación humana y automática.
  • Neuroticism es el más difícil y presenta un sesgo general hacia puntuaciones bajas.
  • Varios modelos muestran sesgo hacia alta Agreeableness incluso cuando se pide el extremo opuesto.
  • GPT-3.5 muestra sesgos hacia alta Conscientiousness y Agreeableness y hacia alta Extraversion en parte de las condiciones bajas.
  • GPT-4o controla mejor Openness, Conscientiousness y Extraversion, pero mantiene sesgo hacia alta Agreeableness.
  • Mixtral detecta Conscientiousness solo en 68 de 120 textos y Extraversion en 63 de 120.
  • Claude no sigue siempre el formato: a veces recomienda en vez de responder o revela explícitamente el rasgo.
  • Esas respuestas de Claude fueron editadas manualmente antes del análisis.
  • No se informa cuántas respuestas se editaron ni se conservan versiones originales y modificadas.
  • Figure 3 sugiere que Claude y GPT-4o separan mejor léxicamente los extremos de puntuación.
  • El análisis léxico informa que el 16 % de los patrones identificados en los textos procede de los prompts.
  • Ese solapamiento cuantifica fuga directa de la definición de rasgo hacia la señal evaluada.
  • Los sustantivos y adjetivos diferencian niveles mejor que los verbos en el análisis presentado.
  • Salvo Neuroticism, los textos neutrales comparten hasta un 34 % de patrones con niveles bajos según el manuscrito.
  • Las mismas descripciones de rasgos alimentan la generación y el clasificador GPT-4o, creando circularidad semántica.
  • El artículo reconoce que responder cuestionarios y generar texto pueden producir perfiles incompatibles.
  • La explicación propuesta es que el rol por defecto de asistente favorece alta Agreeableness y baja Neuroticism.
  • El repositorio público contiene un notebook y módulos para BFI-44, generación, clasificación y visualización.
  • El repositorio no contiene los textos generados, las etiquetas humanas, las salidas del clasificador ni las figuras fuente prometidas como dataset.
  • El notebook público no tiene salidas guardadas y configura solo temperatura 0,7 para texto, no las cuatro temperaturas del artículo.
  • El repositorio permite repetir la idea general, pero no reproduce los resultados publicados sin datos, versiones, dependencias y parámetros adicionales.

Limitaciones

  • La versión de texto completo es arXiv v1 y no existe una revisión posterior.
  • El trabajo figura como aceptado bajo el encabezado archival de CustomNLP4U 2024.
  • No tiene ficha individual, páginas ni DOI en los proceedings de ACL Anthology.
  • La ausencia del registro individual no se explica en el sitio del workshop ni en el preprint.
  • El README afirma presentación en el workshop, pero sigue diciendo que enlazará el artículo después de publicarse.
  • El año 2025 corresponde al preprint, mientras la aceptación y presentación declarada son de 2024.
  • El Big Five se describe erróneamente como cinco dicotomías aunque sus rasgos son continuos.
  • El texto afirma que investigación reciente añade Honesty-Humility al Big Five.
  • Honesty-Humility pertenece habitualmente al modelo HEXACO y la cita de Costa y McCrae 2008 no sustenta esa adición.
  • La afirmación de validez transcultural del Big Five se apoya en una referencia de 1985 sobre la validez lógica del MBTI, no en una prueba transcultural del BFI.
  • Las definiciones operativas de rasgo usadas en el código provienen de una página divulgativa de Simply Psychology.
  • No se usan facetas o descriptores validados específicamente para generación de texto.
  • El BFI-44 se diseñó para autoinforme humano, no para medir entidades sin experiencia subjetiva.
  • El cuestionario pide explícitamente actuar como una persona con el rasgo alto o bajo.
  • Después evalúa solo los ítems del mismo rasgo revelado en el prompt.
  • Esa tarea mide obediencia y conocimiento semántico del cuestionario más que personalidad latente.
  • No existe condición sin prompt para cada modelo en el análisis principal.
  • No existe comparación con participantes humanos que reciban instrucciones equivalentes.
  • No se evalúa estabilidad test-retest de una misma configuración.
  • No se informa número de réplicas por ítem y condición del cuestionario.
  • No se informa cómo se calcularon alfa y lambda a partir de las observaciones de modelo.
  • No se informan intervalos de confianza para alfa o lambda.
  • La alfa puede aumentar por redundancia de ítems y no demuestra un constructo real.
  • La lambda tampoco demuestra validez de criterio, convergente o predictiva.
  • La frase real and plausible no se deriva de coeficientes de consistencia interna.
  • No se reporta ninguna prueba de la validez que el método anuncia.
  • Figure 1 carece de intervalos de confianza y tamaños de muestra visibles.
  • No se cuantifica formalmente la separación alta-baja de Figure 1.
  • Las afirmaciones de accurate performance se basan en inspección visual no definida.
  • Los modelos comerciales no se identifican por snapshot salvo Claude.
  • Los alias GPT-3.5 Turbo y GPT-4o pueden cambiar con el tiempo.
  • No se especifica proveedor o versión exacta de Mixtral en el artículo; el código usa un alias de la API de Mistral.
  • No se informan fechas exactas de las llamadas a cada modelo.
  • No se informan parámetros además de temperatura.
  • No se informan top-p, semilla, penalizaciones o longitud máxima comparables.
  • No se controlan diferencias de política de seguridad entre proveedores.
  • No se controlan diferencias de longitud entre respuestas.
  • El diseño de texto espera 2.400 salidas, pero Figure 4 contiene 2.399.
  • La salida ausente de Claude-Openness no se documenta.
  • No se explican errores de API, rechazos o fallos de parseo.
  • La función pública guarda literalmente GPT Fail cuando se agotan los reintentos.
  • No se muestra si esos fallos fueron filtrados en el estudio.
  • Claude recibió edición manual cuando revelaba rasgos o no respondía directamente.
  • No se define un protocolo previo para esa edición.
  • No se informa cuántos casos fueron modificados.
  • No se evalúa cuánto cambian las métricas antes y después de editar.
  • La edición manual se aplica a un modelo y puede romper la comparabilidad.
  • No se preservan públicamente textos crudos y editados.
  • El conjunto multirrasgo se menciona pero se reserva por completo para trabajo futuro.
  • El código público solo implementa generación de un rasgo cada vez.
  • No se informa el número ni la licencia del dataset multirrasgo.
  • Las medias y varianzas del dataset humano no se publican en el artículo.
  • Ajustar distribuciones normales por rasgo no preserva necesariamente correlaciones entre rasgos.
  • No se explica si las puntuaciones humanas se limpiaron o ponderaron.
  • El Big Five Personality Test Dataset es una muestra voluntaria en línea, no representativa.
  • No se usa una partición humana como referencia de lenguaje o conducta.
  • Se anotan solo unas 288 de 2.400 respuestas esperadas.
  • About 288 deja ambiguo el tamaño exacto.
  • El subconjunto se equilibra por modelo y temperatura, pero no se documenta por rasgo, puntuación o pregunta.
  • No se describe el método de muestreo de los 288 textos.
  • No se informa si los anotadores estaban ciegos al modelo.
  • No se informa si estaban ciegos a la puntuación solicitada.
  • No se informa si vieron la pregunta original junto a la respuesta.
  • No se publica la interfaz de anotación completa.
  • No se publican las 864 valoraciones individuales esperadas.
  • No se publican los votos finales por texto.
  • No se publican los fragmentos lingüísticos marcados.
  • No se informa formación de los ocho anotadores.
  • No se informa experiencia en psicología o lingüística.
  • No se informan edad, género, idioma o cultura de los anotadores.
  • No se informa compensación.
  • No se informa consentimiento.
  • No se informa aprobación ética o exención.
  • Tres evaluadores por texto permiten voto, pero una mayoría de dos puede ocultar alta incertidumbre.
  • Kappa de Fleiss entre 0,57 y 0,71 no indica acuerdo perfecto.
  • No se informan intervalos de confianza para kappa.
  • No se analiza sesgo sistemático por anotador.
  • No se calcula fiabilidad de las expresiones subrayadas.
  • GPT-4o se selecciona como clasificador por rendimiento superior sin mostrar la comparación de selección.
  • El clasificador se evalúa en el mismo subconjunto humano usado para justificar su extrapolación.
  • No existe conjunto humano de validación independiente.
  • No se informa si el prompt del clasificador se ajustó después de ver esas etiquetas.
  • GPT-4o clasifica también textos generados por GPT-4o, creando autoevaluación de familia.
  • Generador y clasificador reciben las mismas definiciones de rasgo.
  • El 16 % de patrones heredados del prompt evidencia fuga de características.
  • El clasificador puede premiar la repetición semántica del prompt en lugar de personalidad coherente.
  • F1 ponderado oculta rendimiento de clases minoritarias.
  • No se publican soportes por clase en Table 2.
  • No se publican matrices de confusión humano-clasificador para los tres niveles.
  • No se informa exactitud global ni macro-F1.
  • El F1 de 0,50 y MAE 1,77 para Neuroticism limitan su uso como etiqueta automática.
  • El peor rendimiento del clasificador coincide con el principal hallazgo sustantivo sobre Neuroticism.
  • No se propaga la incertidumbre del clasificador a las conclusiones por modelo.
  • Los casos Nondistinguishable se excluyen de Figure 2.
  • Excluir abstenciones puede inflar la precisión aparente de los niveles detectados.
  • Figure 4 muestra detectabilidad por separado, pero no ofrece una métrica conjunta de cobertura y exactitud.
  • No se compara el clasificador con una regla léxica sencilla o un clasificador supervisado.
  • No se compara con un evaluador humano adicional en todo el corpus.
  • No se realizan pruebas estadísticas entre modelos.
  • No se realizan pruebas estadísticas entre temperaturas.
  • No se informan intervalos de confianza para proporciones de detección.
  • No se corrige por múltiples comparaciones.
  • No se informa sensibilidad a otras redacciones de prompts.
  • No se informa sensibilidad a otras definiciones de rasgo.
  • No se informa sensibilidad a otras seis preguntas.
  • Las seis preguntas cubren preferencias y aspiraciones, no conversación prolongada.
  • No se evalúa consistencia entre turnos.
  • No se evalúa memoria de personalidad.
  • No se evalúa resistencia a instrucciones conflictivas.
  • No se evalúa interacción entre rasgos.
  • No se evalúan perfiles complejos con los cinco rasgos en los resultados.
  • No se evalúan idiomas distintos del inglés.
  • No se evalúan culturas distintas.
  • No se evalúan tareas con consecuencias conductuales.
  • No se evalúa empatía o satisfacción de usuarios pese a motivarlas en la introducción.
  • No se evalúa seguridad de inducir alta Neuroticism u otros rasgos sensibles.
  • No se estudia estigmatización de niveles altos o bajos.
  • No se valida que las respuestas parezcan escritas por humanos con puntuaciones BFI conocidas.
  • No se incluye un corpus humano con ground truth de personalidad para comparación.
  • La similitud TF-IDF puede reflejar la pregunta compartida más que el rasgo.
  • El código busca vecinos globales y después filtra los que comparten rasgo, una operación distinta de buscar cinco vecinos dentro de cada rasgo.
  • El código público visualiza similitud media, mientras el artículo describe puntuaciones medias de los cinco textos más similares.
  • No se publica el código exacto que generó Figure 3.
  • SVD de 500 componentes no se justifica ni se analiza por sensibilidad.
  • No se compara TF-IDF con embeddings semánticos.
  • El análisis de lemas no controla frecuencia base ni longitud.
  • No se informa una prueba estadística para diferencias entre sustantivos, adjetivos y verbos.
  • El 34 % de solapamiento no se acompaña de denominador o intervalo.
  • Appendix D presenta listas de palabras sin frecuencias ni criterios completos de selección.
  • Algunos lemas visibles están truncados o son artefactos, como bogge y extroverte.
  • El repositorio fue actualizado por última vez antes del preprint y no contiene cambios posteriores que cierren la reproducción.
  • El repositorio no contiene el dataset que el PDF dice disponible en el mismo enlace.
  • El repositorio no contiene resultados del cuestionario.
  • El repositorio no contiene textos generados.
  • El repositorio no contiene anotaciones humanas.
  • El repositorio no contiene salidas del clasificador.
  • El notebook no contiene outputs ejecutados.
  • No existe requirements.txt, pyproject.toml ni lockfile.
  • Las dependencias no están versionadas.
  • El notebook instala solo tres SDK, aunque el código requiere pandas, NumPy, matplotlib, seaborn y scikit-learn.
  • La ruta de fallback para respuestas BFI inválidas usa una variable pipe que no se define en el repositorio.
  • Esa rama produce NameError si un modelo no devuelve exactamente una opción permitida.
  • El parser del clasificador intenta reparar JSON con sustituciones ad hoc sin validar tipos ni rangos.
  • No hay tests automatizados.
  • No hay integración continua.
  • No hay datos de ejemplo con resultados esperados.
  • El notebook público configura solo temperatura 0,7 para generación de texto.
  • El notebook configura solo temperatura 0,9 para el cuestionario.
  • El artículo usa cuatro temperaturas y el repositorio no documenta cómo obtener exactamente esa ejecución.
  • No hay semillas de NumPy o de muestreo reproducibles.
  • No se registran identificadores de respuesta de las APIs.
  • No se registran hashes de prompts o configuración.
  • No se informa coste, tokens, latencia o fechas de ejecución.
  • La dependencia de APIs comerciales impide reproducir snapshots históricos sin las salidas originales.
  • No hay preregistro.
  • No hay replicación independiente.
  • Las limitaciones declaradas por los autores omiten la mayoría de estos problemas de medición y reproducción.

Qué no demuestra

  • No demuestra que los LLM tengan personalidad psicológica.
  • No demuestra que las respuestas BFI-44 de un LLM sean reales o plausibles por superar alfa 0,85.
  • No demuestra validez de constructo, convergente, discriminante o predictiva.
  • No demuestra estabilidad de rasgos entre sesiones.
  • No demuestra estabilidad entre cuestionario y generación libre.
  • No demuestra perfiles completos de cinco rasgos porque el análisis principal induce uno cada vez.
  • No demuestra control fino de cinco niveles, ya que los niveles medios se confunden con extremos.
  • No demuestra que Openness o Neuroticism se comporten igual en otros prompts o idiomas.
  • No demuestra que la baja Neuroticism refleje personalidad en vez de política de asistente y seguridad.
  • No demuestra que alta Agreeableness sea un rasgo estable en vez de alineación conversacional.
  • No demuestra que el clasificador GPT-4o sea una medida independiente del generador.
  • No demuestra exactitud del clasificador para Neuroticism.
  • No demuestra que excluir casos no distinguibles preserve una comparación imparcial.
  • No demuestra que la edición manual de Claude no altere los resultados.
  • No demuestra que similitud TF-IDF equivalga a similitud de personalidad.
  • No demuestra que los patrones léxicos no procedan del prompt; el propio estudio atribuye un 16 % a esa fuente.
  • No demuestra que textos generados se parezcan a textos de personas con BFI conocido.
  • No demuestra comportamiento humano fuera de seis preguntas breves.
  • No demuestra calidad de diálogo, empatía, engagement o satisfacción de usuario.
  • No demuestra utilidad en agentes multiagente, juegos o aplicaciones empresariales.
  • No demuestra seguridad para personalización psicológica.
  • No demuestra generalización cultural o multilingüe.
  • No demuestra reproducibilidad de cifras y figuras con el repositorio publicado.
  • No demuestra disponibilidad del dataset que el artículo afirma liberar.
  • No establece una publicación individual en ACL Anthology ni un DOI del artículo.
  • No justifica usar estas salidas como sustitutos de evaluaciones psicológicas humanas.

Trazabilidad

Alcance: Texto completo

Versión: arXiv 2502.08265v1, 12 Feb 2025; open 12-page preprint after CustomNLP4U 2024 acceptance

Fuente consultada: https://arxiv.org/pdf/2502.08265v1

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, workshop-proceedings, psychometric-validity, human-annotation, metric, code-artifact, reproducibility, ethics and internal-consistency audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-3.5 Turbo
  • GPT-4o
  • Claude 3 Haiku (claude-3-haiku-20240307 in the repository)
  • Mixtral 8x22B (open-mixtral-8x22b in the repository)

Instrumentos y métricas

  • Big Five Inventory 44 (BFI-44)
  • Cronbach's alpha
  • Guttman's lambda
  • Fleiss' kappa
  • Weighted precision, recall and F1
  • Mean absolute error (MAE)
  • GPT-4o CARP-style trait classifier
  • TF-IDF nearest-text analysis
  • spaCy lemmatization and part-of-speech analysis

Datos utilizados

  • Big Five Personality Test Dataset (1,015,342 questionnaire responses)
  • Six open-ended personality questions
  • LLM-generated single-trait text corpus
  • Human annotation subset of about 288 generated texts
  • Generated multi-trait profiles sampled from fitted normal distributions, mentioned but not analyzed

Evidencia y localización

  • Identidad y versión citable: arXiv 2502.08265v1, submitted 12 Feb 2025; title page lists Maria Molchanova, Anna Mikhailova, Anna Korzanova, Lidiia Ostyakova and Alexandra Dolidze
  • Texto completo inspeccionado: .cache/editorial-sources/article-088/source.pdf; 12 pages; sha256 0160d1f7d12b4e699d07bd7efa474a68551fd985fad2e30d2c01c9aa3459c3f5
  • Aceptación de workshop: Official CustomNLP4U 2024 Accepted Papers page, archival section, lists the title and five authors; workshop held at EMNLP on 16 Nov 2024
  • Ausencia de registro individual en proceedings: ACL Anthology CustomNLP4U 2024 volume and event index inspected 15 Jul 2026: no title or Molchanova record; no paper DOI or pages found
  • Pregunta y diseño general: Abstract, Introduction and Section 3, pp. 1-2
  • Cuestionario inducido: Section 4 and Appendix C.1, pp. 2-3 and 10; high/low single-trait prompts over corresponding BFI-44 items
  • Fiabilidad informada: Section 4 p. 3 and Table 4 p. 10: alpha 0.87-0.94, lambda 0.95-0.97; prose calls responses real and plausible
  • Separación del cuestionario: Figure 1 and adjacent prose, p. 3
  • Diseño de generación de texto: Section 5.1 and Appendix C.2, pp. 3-4 and 10-11: six questions, scores 1-5 and temperatures 0, 0.5, 0.7, 0.9
  • Edición manual de Claude: Section 5.1, p. 4: direct trait disclosures were masked and task-misaligned content removed
  • Muestra y anotación humana: Section 5.2, p. 4: about 288 texts, eight annotators, three raters per text, -2 to +2 scores, voting and highlighted patterns
  • Acuerdo humano: Table 1, p. 4: Fleiss kappa Level 1 0.59-0.71 and Level 2 0.57-0.70
  • Clasificador automático: Section 5.3 and Appendix C.3, pp. 4-5 and 11: GPT-4o CARP-style clues, reasoning, score and decision type
  • Rendimiento del clasificador: Tables 2-3, p. 5: weighted F1 Level 1 0.87-0.63; Level 2 0.78-0.50; MAE 0.44-1.77
  • Matrices condicionadas a detectabilidad: Figure 2, pp. 5-6, and public code experiment_functions/qa_text_generation.py: rows with decision type Nondistinguishable are removed before crosstab
  • Conteos de detectabilidad: Figure 4, p. 10: 2,399 total cases; Claude-Openness 3 nondistinguishable plus 116 detected; all other model-trait panels total 120
  • Hallazgos por modelo y rasgo: Section 5.3, pp. 5-7; Figure 2 confusion matrices and Figure 5 nondistinguishable breakdown
  • Análisis TF-IDF: Section 5.4 and Figure 3, pp. 6-7
  • Fuga léxica desde prompts: Section 5.4, p. 7: 16% of linguistic patterns derived from prompts and up to 34% shared by neutral and low lexicons
  • Conclusión limitada del estudio: Discussion and Conclusion, p. 8: task-dependent behavior, Agreeableness/Neuroticism bias and questionnaire-text inconsistency
  • Limitaciones declaradas: Limitations, p. 8: Big Five assumptions, unmodeled size/training-data effects and partial human annotation
  • Repositorio público: https://github.com/mary-silence/simulating_personality at commit 9c02fd5c757928f66cdb338bac0c3d22fcd22e10, last push 12 Nov 2024; inspected 15 Jul 2026
  • Dataset y resultados ausentes: Repository tree at commit 9c02fd5: README, one notebook, source modules, BFI-44 items, trait definitions and six questions; no results, generated dataset or annotations
  • Configuración no equivalente: main.ipynb at commit 9c02fd5: text generation temperatures [0.7], questionnaire temperature 0.9 and no saved outputs; paper reports four text temperatures
  • Defecto reproducible de código: experiment_functions/questionnaire.py match_score references undefined pipe on invalid model answers; repository contains no pipe definition
  • Dependencias y QA ausentes: Repository commit 9c02fd5 has no requirements file, lockfile, tests or CI; notebook installs only openai, anthropic and mistralai
  • Discrepancia del análisis de similitud: Public experiment_functions/qa_text_generation.py computes global top-5 neighbors then filters same-trait and plots mean similarity matrices; paper Figure 3 describes averaged trait scores of five most similar texts
  • Lectura y comprobación visual integral: All 12 pages rendered and inspected, including Figures 1-5, Tables 1-4, prompts, Appendix D, limitations and references; checked 15 Jul 2026