Beyond Self-Reports: Multi-Observer Agents for Personality Assessment in Large Language Models

Evaluación y validez psicométrica2025ACL AnthologyRevisión editorial aprobada

Autores: Yin Jou Huang, Rafik Hadfi

Palabras clave: Computation and Language, Artificial Intelligence, Personality Assessment, Multi-Observer Framework

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
12
Hallazgos
23
Limitaciones
13
Evidencias

Resumen editorial

Español

El trabajo adapta la lógica psicológica de los informant reports a agentes LLM: en vez de pedir solo al modelo sujeto que complete un cuestionario sobre sí mismo, hace que varios agentes observadores conversen con él en escenarios de amistad, familia o trabajo y después puntúen su conducta con 50 ítems IPIP del Big Five. El experimento principal crea 100 sujetos condicionados mediante perfiles, 15 observadores por sujeto, cinco por contexto relacional, y cinco escenarios por pareja. GPT-4o genera relaciones y escenarios y ocupa los roles de sujeto y observador; el apéndice repite análisis con Qwen2.5-72B-Instruct y Llama-3-70B-Instruct. Las puntuaciones de 5 a 15 observadores se promedian y se comparan con el perfil inyectado, el self-report y una pequeña evaluación humana.

El resultado central es una separación entre instrucción y conducta simulada. El self-report correlaciona casi perfectamente con el perfil de rasgos insertado en el prompt, 0,93 a 0,97 según dimensión, mientras el informe agregado de observadores correlaciona menos con esa instrucción, 0,55 a 0,86, pero suele aproximarse mejor a cómo humanos juzgan los diálogos. En la tabla principal, el observador supera al self-report frente al juicio humano en apertura, agradabilidad y neuroticismo, y queda ligeramente por debajo en consciencia y extraversión; en el apéndice, su distancia absoluta es menor para las cinco dimensiones y los tres modelos. Las curvas de correlación se estabilizan aproximadamente con cinco a siete observadores. También aparecen desviaciones sistemáticas: los observadores puntúan agradabilidad 0,91 puntos y consciencia 0,39 puntos por encima del propio sujeto, con d de Cohen 1,07 y 0,46; familia, amistad y trabajo alteran esas dos dimensiones.

La aportación valiosa no es demostrar una personalidad interna, sino mostrar que un perfil declarado puede no coincidir con la conducta generada. El caso cualitativo es ilustrativo: un sujeto instruido como muy desagradable se autocalifica en 1,7, pero produce un diálogo más bien cauteloso y cooperativo y los observadores le asignan alrededor de 3. El diseño amplía el self-report con evidencia conductual, prueba tres familias de modelos, cuatro variantes de prompt, orden inverso y batch, y añade una comparación humana con acuerdo entre evaluadores. Es una dirección metodológica prometedora para medir fidelidad conductual de personas inducidas.

No obstante, los «informantes» no son observadores externos independientes: en la condición principal son instancias del mismo GPT-4o que genera perfiles, relaciones, escenarios, ambos lados del diálogo y la puntuación IPIP. Observadores y humanos ven los diálogos, mientras el self-report recibe directamente los marcadores de personalidad; esa asimetría favorece estructuralmente la coincidencia observador–humano y la coincidencia self-report–prompt. El perfil inyectado no es ground truth psicológico, promediar agentes correlacionados no establece fiabilidad y la meseta de cinco a siete no se valida con intervalos, remuestreo ni conjunto externo. La evidencia humana comprende 16 casos con dos evaluadores por caso; el checklist, sin embargo, habla de 12 participantes y confirma que no hubo aprobación o exención de un comité ético. El repositorio que la versión final declara disponible responde 404, de modo que prompts, outputs y análisis no son actualmente reproducibles. La conclusión defendible es que informes multiagente capturan mejor la impresión humana de estas conversaciones sintéticas bajo este protocolo, no que midan una personalidad verdadera o más objetiva del LLM.

English

The paper adapts the psychological logic of informant reports to LLM agents. Instead of asking only a subject model to complete a questionnaire about itself, multiple observer agents converse with the subject in friendship, family, or workplace scenarios and then rate its behavior using 50 IPIP Big Five items. The main experiment creates 100 prompt-conditioned subjects, 15 observers per subject, five for each relational context, and five scenarios per subject–observer pair. GPT-4o generates relationships and scenarios and fills both subject and observer roles; the appendix repeats analyses with Qwen2.5-72B-Instruct and Llama-3-70B-Instruct. Ratings from groups of 5 to 15 observers are averaged and compared with the injected profile, self-report, and a small human evaluation.

The central result is a separation between instruction and simulated behavior. Self-report correlates almost perfectly with the trait profile inserted into the prompt, 0.93 to 0.97 depending on the dimension, whereas aggregated observer reports correlate less with that instruction, 0.55 to 0.86, but generally approximate human judgments of the dialogues more closely. In the main table, observer reports outperform self-report against human judgment for openness, agreeableness, and neuroticism and are slightly lower for conscientiousness and extraversion; in the appendix, their absolute distance is smaller for all five dimensions and all three models. Correlation curves stabilize at roughly five to seven observers. Systematic deviations also appear: observers rate agreeableness 0.91 points and conscientiousness 0.39 points above the subject’s self-rating, with Cohen’s d values of 1.07 and 0.46; family, friendship, and workplace contexts affect these two dimensions.

The valuable contribution is not evidence of internal personality but evidence that a declared profile can diverge from generated behavior. The qualitative case is illustrative: a subject instructed to be highly disagreeable gives itself an agreeableness score of 1.7, but produces a cautious and fairly cooperative dialogue and receives observer ratings around 3. The design supplements self-report with behavioral material, tests three model families, four prompt variants, reversed scale order and batch presentation, and adds a human comparison with inter-rater agreement. It is a promising methodological direction for measuring behavioral fidelity in induced personas.

However, the “informants” are not independent external observers. In the main condition, they are instances of the same GPT-4o that generates profiles, relationships, scenarios, both sides of the dialogue, and IPIP ratings. Observers and humans see the dialogues, while self-report directly receives the personality markers; this asymmetry structurally favors observer–human agreement and self-report–prompt agreement. The injected profile is not psychological ground truth, averaging correlated agents does not establish reliability, and the five-to-seven plateau is not validated with confidence intervals, resampling, or an external test set. Human evidence covers 16 cases with two raters per case, while the Responsible NLP checklist instead mentions 12 participants and confirms that no ethics-board approval or exemption was obtained. The repository declared available in the final paper returns 404, so prompts, outputs, and analyses are not currently reproducible. The defensible conclusion is that multi-agent reports better capture human impressions of these synthetic conversations under this protocol, not that they measure a true or more objective LLM personality.

Pregunta de investigación

¿Puede una evaluación Big Five agregada de múltiples agentes observadores, tras conversar con un agente sujeto en distintos contextos relacionales, reflejar mejor su conducta simulada y el juicio humano que el self-report directo del propio LLM?

Método

Experimento de simulación multiagente. Cada sujeto recibe nombre, edad, género y un vector Big Five de cinco niveles enteros 1–6 convertido en tres marcadores adjetivales por rasgo. Para 100 sujetos se asignan 15 observadores, cinco familiares, cinco amigos y cinco relaciones laborales, y GPT-4o genera cinco escenarios por pareja. Sujeto y observador alternan diálogo hasta acordar terminar. El sujeto completa 50 ítems IPIP sobre sí mismo; cada observador completa los mismos ítems sobre el sujeto usando los diálogos, y el informe colectivo es la media de N observadores. Se calculan correlaciones de Spearman con el perfil inyectado, self-report y ratings humanos; desviaciones, t tests pareados y d de Cohen; curvas con 1–15 observadores; efectos de relación; y sensibilidad a modelo, estilo de prompt, orden de escala y batch. Simulación a temperatura 1, cuestionarios a 0. La revisión editorial leyó las 16 páginas publicadas, tablas, figuras, prompts y checklist, y comprobó DOI y artefacto enlazado.

Muestra: El experimento principal usa 100 instancias de sujeto del mismo GPT-4o, no 100 modelos ni personas independientes. Cada una se combina con 15 instancias observadoras y cinco escenarios por pareja, es decir, 75 conversaciones sintéticas potenciales por sujeto antes de agregar ratings. Los análisis de sensibilidad incluyen Qwen2.5-72B-Instruct y Llama-3-70B-Instruct. La evaluación humana publica 16 casos de sujeto con dos evaluadores por caso; los participantes son anglófonos nativos residentes en Reino Unido, Estados Unidos, Nueva Zelanda, Canadá o Australia, tardan aproximadamente 15 minutos y reciben 2,25 GBP. El manuscrito no aclara de forma reconciliable cuántas personas únicas participaron: el checklist declara 12 participantes, mientras el apéndice describe 16 casos, dos anotadores por caso y cinco diálogos por participante.

Hallazgos

  • El self-report sigue casi exactamente el perfil inyectado: correlaciones de Spearman de 0,97 en apertura, 0,95 en consciencia y extraversión, 0,94 en agradabilidad y 0,93 en neuroticismo.
  • El informe agregado de observadores correlaciona menos con el perfil inyectado: 0,55, 0,85, 0,84, 0,84 y 0,86 respectivamente, lo que evidencia una brecha entre instrucción directa y conducta dialogada.
  • Frente a humanos, el observador mejora apertura de −0,25 a 0,48, agradabilidad de 0,63 a 0,85 y neuroticismo de 0,22 a 0,42; el self-report queda ligeramente por encima en consciencia y extraversión en la tabla principal.
  • En el apéndice, la distancia absoluta a ratings humanos es menor para observadores que para self-report en las cinco dimensiones y en GPT-4o, Qwen2.5 y Llama-3.
  • El acuerdo entre los dos evaluadores humanos es heterogéneo: Pearson 0,31 en apertura, 0,69 en consciencia, 0,73 en extraversión, 0,59 en agradabilidad y 0,45 en neuroticismo.
  • La correlación agregada suele crecer y estabilizarse aproximadamente al incorporar cinco a siete observadores; apertura permanece más baja, alrededor de 0,60–0,65.
  • Los observadores puntúan la agradabilidad 0,91 puntos por encima del self-report, con d = 1,07, y la consciencia 0,39 puntos por encima, con d = 0,46; ambas diferencias se declaran significativas a p < 0,05.
  • No se identifican desviaciones significativas de self-report frente a observador en apertura, extraversión o neuroticismo para GPT-4o en la condición principal.
  • Trabajo frente a familia/amistad cambia consciencia, y familia frente a trabajo cambia agradabilidad; las otras tres dimensiones no muestran diferencias significativas entre contextos.
  • Qwen2.5 y Llama-3 reproducen la desviación positiva de agradabilidad y, en menor medida, consciencia; Qwen2.5 añade una desviación significativa en apertura.
  • Las variantes neutral, escala invertida y batch mantienen el patrón general de desviación, aunque las magnitudes cambian y algunas significancias no se conservan.
  • El caso cualitativo muestra que un prompt de agradabilidad mínima produce un self-report de 1,7, pero el diálogo conserva cooperación y los observadores agregados asignan 3,0.

Limitaciones

  • El perfil latente es una instrucción escrita, no una variable psicológica observada ni ground truth independiente; mide la personalidad que se pidió simular.
  • El self-report recibe explícitamente los marcadores que después puntúa, por lo que su correlación casi perfecta con el perfil inyectado es en parte una consecuencia mecánica del diseño.
  • Observadores y humanos evalúan el mismo material conductual, mientras el self-report evalúa una instrucción interna sin esos diálogos; la comparación enfrenta fuentes de información distintas.
  • GPT-4o genera relaciones y escenarios y actúa como sujeto, interlocutor y juez en el experimento principal, creando circularidad y sesgos compartidos.
  • Los observadores no son modelos, entrenamientos o personas independientes: son instancias correlacionadas del mismo sistema. La hipótesis de que errores aleatorios se cancelan no se prueba.
  • El observador participa en el diálogo que después juzga; sus propias respuestas pueden moldear la conducta del sujeto y su posterior evaluación.
  • El uso de IPIP por otro LLM no elimina la posible contaminación por conocimiento del test; desplaza el cuestionario desde el sujeto hacia un modelo-juez que también puede reconocerlo.
  • Las relaciones y escenarios no se asignan como estímulos equivalentes entre condiciones. Diferencias entre familia, amistad y trabajo pueden proceder del contenido generado, no del contexto relacional por sí solo.
  • La meseta de cinco a siete observadores se identifica visualmente en las mismas curvas usadas para evaluarla, sin intervalo de confianza, bootstrap, conjunto de validación o comparación formal de coste y precisión.
  • La analogía con el número de Dunbar es post hoc y no constituye evidencia de que agentes sintéticos compartan la estructura social humana.
  • La muestra humana es pequeña: 16 casos con dos evaluadores. Correlaciones por rasgo con ese n son inestables y no se acompañan de intervalos de confianza.
  • El acuerdo humano es bajo para apertura y moderado para neuroticismo, limitando la fuerza del criterio que se utiliza para declarar validez.
  • No se presenta una comparación directa con codificadores humanos entrenados, clasificadores de conducta o observadores de otra familia que permita aislar el valor específico del marco multiagente.
  • Los t tests tratan instancias condicionadas del mismo modelo como observaciones; no se discute pseudorreplicación, dependencia por sujeto/observador/escenario ni un modelo jerárquico.
  • Se prueban cinco rasgos y múltiples relaciones, modelos y prompts sin corrección por comparaciones múltiples; se muestran asteriscos, pero no p exactos ni intervalos.
  • El d de Cohen se describe con desviación estándar combinada pese al diseño pareado, sin especificar con precisión la variante del estimador.
  • La afirmación de que alignment training origina los sesgos de agradabilidad y consciencia es especulativa: no se manipula entrenamiento ni se comparan checkpoints pre/post alignment.
  • Nombres, edades, género, relaciones y escenarios generados pueden introducir estereotipos, pero no se auditan efectos demográficos, contenido o sesgo del generador.
  • La sección de limitaciones reconoce escenarios y relaciones simplificados y discrepancias entre escalas, pero no analiza riesgos de aplicar estos ratings en salud mental, educación o empleo.
  • El checklist declara que no hubo aprobación ni determinación de exención ética; su cifra de 12 participantes no concuerda con la descripción de 16 casos y dos anotadores por caso del apéndice.
  • La versión publicada enlaza un repositorio GitHub como código disponible, pero la URL devuelve 404 y no se encontró un repositorio sustituto identificable; no pueden auditarse datos, seeds, scripts o exclusiones.
  • Los resultados se basan en GPT-4o, Qwen2.5-72B-Instruct y Llama-3-70B-Instruct con configuración de 2024–2025 y no generalizan automáticamente a versiones posteriores.
  • El coste publicado, aproximadamente 2,9 USD por sujeto GPT-4o, no incluye una contabilidad total de tokens, fecha/snapshot exacto de servicio o varianza entre ejecuciones.

Qué no demuestra

  • No demuestra que un LLM posea una personalidad interna, estable o equivalente a la personalidad humana.
  • No demuestra que el informe de observadores sea objetivo; muestra mayor coincidencia con una pequeña muestra de impresiones humanas sobre los mismos diálogos.
  • No demuestra validez de constructo, factorial, criterial o predictiva del IPIP aplicado a agentes LLM.
  • No demuestra que el perfil inyectado sea la personalidad verdadera del agente ni que desviarse de él sea necesariamente un error.
  • No demuestra que cinco a siete sea un número óptimo universal de observadores; es una meseta descriptiva de este protocolo.
  • No demuestra un efecto de sabiduría colectiva entre fuentes independientes, porque las instancias comparten modelo, prompts y generador.
  • No establece causalmente que alignment training produzca las desviaciones observadas.
  • No prueba que familia, amistad o trabajo causen cambios de percepción separados de los escenarios y diálogos generados para cada condición.
  • No muestra que las puntuaciones predigan satisfacción, seguridad, calidad de interacción o outcomes humanos en aplicaciones reales.
  • No valida su uso para selección, diagnóstico, educación, salud mental, relaciones o decisiones de alto impacto.
  • No permite generalizar a todos los LLM, idiomas, culturas, arquitecturas o interacciones longitudinales.
  • No ofrece actualmente una reproducción independiente de los resultados porque el artefacto público enlazado no está disponible.

Trazabilidad

Alcance: Texto completo

Versión: Findings of ACL: EMNLP 2025, pp. 21086–21101, DOI 10.18653/v1/2025.findings-emnlp.1150; 16-page published PDF and Responsible NLP checklist reviewed; referenced GitHub artifact returned HTTP 404 on 15 Jul 2026

Fuente consultada: https://aclanthology.org/2025.findings-emnlp.1150.pdf

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • OpenAI GPT-4o (main subject, observer, relationship and scenario generator)
  • Qwen/Qwen2.5-72B-Instruct (appendix sensitivity analysis)
  • meta-llama/Meta-Llama-3-70B-Instruct (appendix sensitivity analysis)

Instrumentos y métricas

  • 50-item International Personality Item Pool (IPIP) Big Five questionnaire
  • Five-point Likert self-report
  • Five-point Likert individual observer-report
  • Mean aggregated multi-observer report
  • Injected Big Five profile with three bipolar personality markers per dimension
  • Spearman rank correlation
  • Paired-samples t test
  • Cohen's d
  • Absolute difference from human ratings
  • Pearson inter-rater correlation for human ratings

Datos utilizados

  • Synthetic agent profiles: common US names, random age 15–80, gender and injected Big Five levels
  • 100 prompt-conditioned subject agents in the main experiment
  • 15 observer agents per subject: five family, five friend and five workplace relations
  • Five GPT-4o-generated scenarios per subject–observer pair
  • Self-report and observer-report IPIP ratings
  • Human judgment set: 16 subject cases, two annotators per case
  • Prompt-sensitivity conditions: default, neutral, reversed scale and 50-item batch

Evidencia y localización

  • Publicación final, DOI, objetivo y marco de informant reports: Findings of ACL: EMNLP 2025, pp. 21086–21087, abstract and sections 1–2
  • Perfiles, contextos, generación de escenarios y tres tipos de informe: Published paper, sections 3.1–3.3, pp. 21088–21089
  • 100 sujetos, 15 observadores, cinco escenarios, IPIP-50 y modelos: Published paper, section 4, p. 21090; Appendix A.3–A.4, pp. 21098–21100
  • Correlaciones con perfil latente y ratings humanos: Published paper, Table 1 and section 5.1, pp. 21090–21091; Appendix Tables 5–6, pp. 21100–21101
  • Efecto descriptivo de 5–7 observadores y analogía con Dunbar: Published paper, section 5.2 and Figure 3, pp. 21091–21092
  • Desviaciones de agradabilidad y consciencia, t tests y d de Cohen: Published paper, Table 2 and section 5.3, pp. 21092–21093
  • Efecto del contexto relacional y especulación sobre alignment: Published paper, section 5.4 and Figure 4, p. 21093
  • Caso de desacuerdo entre prompt, self-report y conducta: Published paper, section 5.5 and Tables 3–4, pp. 21093–21095
  • Variaciones de modelo/prompt, temperatura, infraestructura y coste: Published paper, Appendix A.3–A.4 and Figure 5, pp. 21098–21100
  • 16 casos, dos anotadores, reclutamiento, compensación y acuerdo humano: Published paper, Appendix A.5, Tables 5–7, pp. 21100–21101
  • Limitaciones declaradas de escenarios, relaciones y escalas: Published paper, Limitations, p. 21095
  • Ausencia de revisión ética y discrepancia de muestra: Responsible NLP Checklist for 2025.findings-emnlp.1150, item D4 reports 12 participants and no ethics-board approval/exemption; Appendix A.5 reports 16 cases with two annotators each
  • Artefacto público no disponible: Published paper footnote 1 links github.com/leslie071564/llm_personality_observer; GitHub API returned HTTP 404 and repository/code searches found no replacement on 15 Jul 2026