Beyond Demographics: Aligning Role-playing LLM-based Agents Using Human Belief Networks

Sociedad, cultura y comportamiento colectivo2024ACL AnthologyRevisión editorial aprobada

Autores: Yun-Shiuan Chuang, Krirk Nirunwiroj, Zach Studdiford, Agam Goyal, Vincent V. Frigo, Sijia Yang, Dhavan V. Shah, Junjie Hu, Timothy T. Rogers

Palabras clave: Human belief networks, Role-playing agents, Opinion alignment, In-context learning, Supervised fine-tuning

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

9
Autores
11
Hallazgos
22
Limitaciones
5
Evidencias

Resumen editorial

Español

El estudio pregunta si una opinión real de una persona ayuda a un LLM que la representa a aproximar sus demás opiniones mejor que una ficha demográfica. Parte de 564 participantes estadounidenses de Amazon Mechanical Turk encuestados en 2018: cada uno valoró 64 afirmaciones con una escala forzada de seis puntos y aportó datos demográficos. Un análisis previo de las correlaciones entre los 64 temas aplica PCA con rotación Varimax, retiene nueve factores ortogonales que explican el 72% de la varianza de la matriz y asigna cada tema al factor donde más carga. El tema con mayor carga de cada factor funciona como opinión semilla y los otros 55 como pruebas. Con ChatGPT, GPT-4o-mini, Mistral-7B y Llama-3.1-8B, el paper compara un rol genérico, solo demografía, la opinión semilla sola, demografía más una semilla del mismo factor, demografía más una semilla de otro factor y un techo que revela también la respuesta objetivo. La demografía sola no mejora de forma consistente: frente al rol genérico, el MAE medio baja en GPT-4o-mini y Llama, pero sube en ChatGPT y Mistral. En cambio, demografía más semilla del mismo factor logra el menor MAE medio no supervisado en los cuatro modelos: 1,34, 1,16, 1,29 y 1,60, frente a 1,67, 1,35, 1,55 y 2,16 al usar una semilla de otro factor. Un control con enunciados invertidos conserva el orden, aunque debilita algo el resultado. El ajuste fino con gpt-3.5-turbo-0125 muestra el mismo patrón descriptivo, pero solo para los factores Ghost y Partisan, 18 temas en total. La conclusión estrecha es útil: dentro de esta muestra, conocer una opinión correlacionada permite predecir mejor otras respuestas de esa misma persona que conocer solo sus datos demográficos. No obstante, no es validación externa. Los mismos 564 participantes y también sus respuestas de prueba se usaron para descubrir los factores, asignar temas y elegir las semillas; no hay personas, encuesta ni oleada independientes. El texto habla de efectos 'significativos' sin intervalos ni tests, no reporta semillas o repeticiones y afirma que el MAE va de 0 a 4 aunque la codificación publicada de −3 a +3 permite diferencias de hasta 6. Los datos solo se obtienen contactando a los autores y, pese a prometer su liberación, no se localizó código, outputs ni scoring públicos. Por ello el trabajo respalda asociación y predicción interna, no causalidad, propagación de creencias ni 'gemelos digitales' fieles y generalizables.

English

The study asks whether one real opinion from a person helps an LLM representing that person approximate their other opinions better than a demographic profile does. It uses 564 US Amazon Mechanical Turk participants surveyed in 2018: each rated 64 statements on a forced six-point scale and supplied demographic attributes. A prior analysis of the 64-topic correlation matrix applies PCA with Varimax rotation, retains nine orthogonal factors explaining 72% of matrix variance, and assigns every topic to its highest-loading factor. The highest-loading topic in each factor becomes the seed opinion and the remaining 55 topics are tests. With ChatGPT, GPT-4o-mini, Mistral-7B and Llama-3.1-8B, the paper compares a generic role, demographics only, the seed opinion only, demographics plus a same-factor seed, demographics plus a different-factor seed, and an upper bound that also reveals the target answer. Demographics alone are not consistently helpful: relative to the generic role, mean MAE falls for GPT-4o-mini and Llama but rises for ChatGPT and Mistral. By contrast, demographics plus the same-factor seed produces the lowest average non-upper-bound MAE for all four models: 1.34, 1.16, 1.29 and 1.60, versus 1.67, 1.35, 1.55 and 2.16 with a different-factor seed. A reverse-framing control preserves the ordering while slightly weakening the result. Fine-tuning gpt-3.5-turbo-0125 gives the same descriptive pattern, but only for the Ghost and Partisan factors, 18 topics in total. The narrow conclusion is useful: within this sample, knowing one correlated opinion predicts the same person's other responses better than demographics alone. It is not external validation, however. The same 564 participants and their eventual test responses were used to discover the factors, assign topics and choose seeds; there are no held-out people, independent survey or later wave. The text calls effects 'significant' without intervals or tests, reports no seeds or stochastic replications, and says MAE ranges from 0 to 4 even though its published -3 to +3 coding permits differences up to 6. The data require contacting the authors and, despite a promised release, no public code, outputs or scoring implementation was found. The work therefore supports internal association and prediction, not causality, belief propagation, or faithful and generalizable digital twins.

Pregunta de investigación

¿Añadir al agente la respuesta real de una persona a un tema central de una red de creencias mejora la concordancia con sus respuestas a otros temas relacionados, frente a usar solo demografía o una opinión de una red distinta?

Método

Se usan 564 respuestas completas a 64 temas. Un PCA previo con rotación Varimax retiene nueve factores y asigna cada tema a su carga máxima; el tema más cargado de cada factor es la semilla y los otros 55 son prueba. Cuatro LLM responden con seis categorías Likert bajo seis condiciones de prompting y se comparan por MAE. gpt-3.5-turbo-0125 se ajusta además con los 564 perfiles y etiquetas, con upsampling, pero el resultado SFT publicado se limita a Ghost y Partisan.

Muestra: 564 personas residentes en Estados Unidos reclutadas en Amazon Mechanical Turk en 2018. Cada una respondió los 64 temas sin opción neutral y aportó nueve clases de información demográfica. En ICL se usan nueve temas semilla y 55 temas de prueba. El SFT reportado evalúa únicamente 18 temas de dos factores.

Hallazgos

  • La demografía sola no mejora de forma consistente el MAE medio frente a un rol genérico: ayuda a GPT-4o-mini y Llama 3.1, pero empeora ChatGPT y Mistral.
  • Demografía más semilla del mismo factor obtiene el menor MAE medio no supervisado en los cuatro modelos.
  • ChatGPT pasa de 1,70 con demografía y 1,67 con semilla aleatoria a 1,34 con semilla del mismo factor; Relative Gain medio, 22,54%.
  • GPT-4o-mini pasa de 1,33 y 1,35 a 1,16; Relative Gain medio, 13,88%.
  • Mistral pasa de 1,51 y 1,55 a 1,29; Relative Gain medio, 26,29%.
  • Llama 3.1 pasa de 1,91 y 2,16 a 1,60; Relative Gain medio, 39,99%.
  • La opinión semilla sin demografía también ayuda, pero la combinación de ambas da el mejor promedio en los cuatro modelos.
  • El control con formulaciones original e invertida mantiene la ordenación, con MAE del mismo factor de 1,41, 1,21, 1,31 y 1,71.
  • La sensibilidad de ChatGPT mantiene la ordenación a temperaturas 0, 0,7 y 1, con MAE 1,37, 1,34 y 1,44 para la condición principal.
  • El SFT de GPT-3.5 en Ghost obtiene 1,29 frente a 2,58 con demografía y 2,31 con factor aleatorio; en Partisan, 1,25 frente a 1,41 y 1,35.
  • Los resultados son descriptivos y heterogéneos por factor; la condición principal no es la mejor en cada combinación individual aunque sí en el promedio de cada modelo.

Limitaciones

  • La red de factores y la evaluación usan las mismas 564 personas y las mismas 64 respuestas; los outcomes de prueba contribuyen a construir los factores que luego se evalúan.
  • No hay participantes retenidos, muestra externa, nueva oleada ni validación confirmatoria de la estructura factorial.
  • El SFT ve los 564 perfiles demográficos y luego evalúa otros temas de esas mismas personas; no prueba generalización a individuos nuevos.
  • El paper usa 'significativamente' y 'correlacionan significativamente' sin reportar correlaciones, pruebas de hipótesis, intervalos o errores estándar.
  • La escala declara valores −3, −2, −1, +1, +2 y +3, pero el texto dice que el MAE máximo es 4; falta una transformación que explique esa incompatibilidad.
  • Relative Gain es la media de nueve razones por factor, no la razón calculada sobre los MAE medios; la agregación debe interpretarse con cuidado.
  • El factor aleatorio no publica selección, seed, número de repeticiones ni promedio sobre sorteos.
  • No se explican parsing, respuestas inválidas, llamadas fallidas ni missingness de los outputs LLM.
  • No hay repeticiones por seed; probar tres temperaturas no cuantifica incertidumbre estocástica.
  • La encuesta fuerza una dirección sin opción neutral y procede de MTurk estadounidense de 2018.
  • La combinación detallada de estado, edad, raza, ingreso, ciudad y afiliación puede identificar perfiles en SFT; no se analiza privacidad o memorización.
  • Un PCA rotado de correlaciones no establece una red causal ni propagación de creencias.
  • El techo revela la respuesta objetivo; mide seguimiento de instrucción además de servir como normalizador.
  • SFT solo cubre Ghost y Partisan, no los nueve factores.
  • La sección de limitaciones dice 18 temas y dos factores, en tensión con el estudio ICL de 64 temas y nueve factores salvo que se refiera solo a SFT.
  • La conclusión habla de temas distantes 'dentro' de la red aunque el control usa factores distintos; es una formulación interna inconsistente.
  • Los datos se obtienen solo contactando a los autores del dataset y no se publican raw responses, loadings reproducibles ni splits.
  • No se localizó código, outputs, scoring o archivos de ajuste fino públicos pese a que la ética dice que se liberará el código.
  • La reproducción depende de snapshots históricos de APIs propietarias y de un modelo Mistral sujeto entonces a licencia no productiva.
  • La página pública de uno de los autores enlaza el título al arXiv equivocado, 2305.14328, en lugar de 2406.17232.
  • El estudio mide elecciones Likert, no diálogo, conducta, persuasión, dinámica social ni comunicación realista.
  • No se evalúan daño, manipulación, targeting, equidad entre grupos ni uso indebido de perfiles psicográficos.

Qué no demuestra

  • No demuestra que la demografía nunca influya; dos modelos mejoran descriptivamente frente al rol genérico.
  • No demuestra predicción de opiniones para personas no vistas.
  • No valida la red factorial fuera de las 564 respuestas que la generaron.
  • No establece causalidad ni que una creencia se propague a otras.
  • No convierte al agente en un gemelo digital fiel de la persona.
  • No demuestra significación estadística de las diferencias.
  • No demuestra el mismo efecto en todos los factores, modelos o participantes.
  • No generaliza SFT a los nueve factores; solo informa dos.
  • No permite reconstruir con certeza la métrica a partir de la escala descrita.
  • No permite reproducir resultados de extremo a extremo con artefactos públicos.
  • No generaliza a otras poblaciones, culturas, épocas, encuestas o formas de expresar opinión.
  • No establece seguridad o idoneidad para simulación social, persuasión o segmentación real.

Trazabilidad

Alcance: Texto completo

Versión: Findings of ACL: EMNLP 2024, pages 14010-14026; arXiv:2406.17232v2 and public-artifact availability audited separately

Fuente consultada: https://aclanthology.org/2024.findings-emnlp.819/

Revisión: Codex 17-page visual, official-ACL, arXiv-v2, full-method, prompt, table-arithmetic, data-quality, transductive-design, metric-scale, stochastic-control, privacy, artifact-availability, reproducibility and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • gpt-3.5-turbo-0125 (ChatGPT and supervised fine-tuning)
  • gpt-4o-mini-2024-07-18
  • Mistral-7B-Instruct-v0.2
  • Llama-3.1-8B-Instruct

Instrumentos y métricas

  • Controversial Beliefs Survey, 64 statements
  • Forced six-point opinion scale: -3, -2, -1, +1, +2, +3
  • PCA with Varimax rotation and scree-plot factor retention
  • Nine highest-loading training topics and 55 test topics
  • Six in-context agent-construction conditions
  • Mean absolute error over paired human and LLM ratings
  • Factor-wise Relative Gain against target-revealing upper bound
  • Original plus reverse-framed prompt control
  • Temperature sensitivity at 0, 0.7 and 1
  • Two-factor supervised fine-tuning comparison

Datos utilizados

  • Controversial Beliefs Survey from Frigo (2022), contact-only access
  • 564 US Amazon Mechanical Turk respondents collected in 2018
  • 64 opinion topics assigned to nine rotated factors
  • Demographics: age, gender, education, race, household income, city size, urban/rural setting, state and political leaning

Evidencia y localización

  • Metadatos, DOI, páginas, autores, licencia y abstract exacto: ACL Anthology 2024.findings-emnlp.819
  • Método, prompts, tablas, métricas, resultados, limitaciones, ética y apéndices: Findings EMNLP 2024 PDF, 17 páginas, sha256 97104f79c6d4e3bae94ab4f0b6f6628f8dc02db3d24dc4504e5b65b6061e8a1e
  • Historial, versión y referencia de publicación: arXiv:2406.17232v2
  • Disponibilidad de código y repositorios públicos: ACL/arXiv artifact links, GitHub global title and ID searches, github.com/yunshiuan public repositories; checked 2026-07-16
  • Auditoría transductiva, escala MAE, control aleatorio, estadística, privacidad, reproducibilidad y fronteras de afirmación: reports/verification/article-246-emnlp-belief-network-transductive-evaluation-metric-code-and-claim-audit.json