Large Language Models as Superpositions of Cultural Perspectives

Inducción y control de rasgos2024arXivRevisión editorial aprobada

Autores: Grgur Kovač, Masataka Sawayama, Rémy Portelas, Cédric Colas, Peter Ford Dominey, Pierre-Yves Oudeyer

Palabras clave: cultural perspectives, personality stability, perspective shift, context dependency, value expression, psychological assessment, perspective controllability

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
32
Hallazgos
43
Limitaciones
32
Evidencias

Resumen editorial

Español

El trabajo propone sustituir la metáfora del LLM como individuo por la del LLM como superposición de perspectivas: el prompt activa conductas, valores y rasgos distintos, por lo que una puntuación aislada no debería interpretarse como atributo estable del modelo. Evalúa respuestas de opción forzada a PVQ, VSM e IPIP, una pregunta por prompt, mediante decodificación codiciosa y 50 permutaciones del orden de las opciones. En GPT-3.5-turbo-0301, cinco conversaciones simuladas, cinco formatos textuales y seis párrafos de Wikipedia sobre géneros musicales cambian significativamente muchas puntuaciones, incluso sin instrucciones explícitas sobre valores; el artículo denomina a esto cambio inesperado de perspectiva. También define controlabilidad como la diferencia entre la puntuación normalizada de los valores inducidos y la media de los no inducidos. En la comparación principal, GPT-3.5-0301 alcanza 0,681 en PVQ, Upstage LLaMA 66B Instruct 0,265 en VSM y GPT-3.5-0613 0,400 en IPIP con sus mejores prompts. El hallazgo robusto es que el formato, el contexto y la formulación alteran fuertemente las respuestas de cuestionario de estos modelos, y que ningún método de inducción domina en todos. Sin embargo, la cuantificación estadística no equivale a estudiar personas: las 50 observaciones son reordenaciones de respuesta del mismo modelo determinista, compartidas entre condiciones, no participantes ni réplicas independientes. Tratarlas como grupos independientes en ANOVA, Tukey y Welch, y equipararlas con personas para calcular Cohen d, estabilidad de rangos e ipsativa, introduce pseudorreplicación y hace que las comparaciones directas con cambios humanos no sean válidas como magnitudes equivalentes. Además, el VSM advierte explícitamente que no sirve para comparar individuos ni un único grupo, justo el uso realizado. El preprint aporta una advertencia importante contra antropomorfizar puntuaciones puntuales, pero no demuestra una ontología interna de perspectivas ni que los LLM cambien más que las personas. La reproducibilidad es parcial: existe código MIT, cuestionarios y scripts, pero el commit contemporáneo al artículo no puede arrancar sin un módulo ausente, fija rutas internas, publica dependencias contradictorias, no incluye resultados y depende de endpoints retirados. El registro de ICLR fue una submission rechazada; la referencia correcta es arXiv v3 de 2023, no proceedings 2024.

English

The paper proposes replacing the LLM-as-individual metaphor with an LLM-as-superposition-of-perspectives metaphor: prompts activate different behaviors, values, and traits, so a score observed in one context should not be interpreted as a stable model attribute. It evaluates forced-choice PVQ, VSM, and IPIP answers, one question per prompt, using greedy decoding and 50 permutations of answer order. For GPT-3.5-turbo-0301, five simulated conversations, five textual formats, and six Wikipedia paragraphs about music genres significantly change many scores even without explicit value instructions; the paper calls this the unexpected perspective shift effect. It also defines controllability as the normalized target-value score minus the mean non-target score. In the main comparison, the best reported settings reach 0.681 for GPT-3.5-0301 on PVQ, 0.265 for Upstage LLaMA 66B Instruct on VSM, and 0.400 for GPT-3.5-0613 on IPIP. The robust finding is that format, context, and wording substantially alter questionnaire outputs and that no induction method dominates across models and instruments. The statistical quantification, however, is not equivalent to a study of people: the 50 observations are answer-order permutations of the same deterministic model, shared across conditions, not participants or independent replications. Treating them as independent groups in ANOVA, Tukey, and Welch tests, and equating them with people for Cohen's d, rank-order stability, and ipsative stability, creates pseudoreplication and makes direct human effect-size comparisons non-equivalent. The VSM manual also explicitly says that the instrument is not for comparing individuals or a single group, which is the use made here. The preprint provides an important warning against anthropomorphizing isolated scores, but it does not establish an internal ontology of perspectives or that LLMs change more than humans. Reproducibility is partial: code, questionnaires, scripts, and an MIT license are public, but the paper-era commit cannot start without a missing module, hard-codes internal paths, declares contradictory dependencies, omits results, and depends on retired endpoints. The ICLR record was a rejected submission; the correct reference is the 2023 arXiv v3 preprint, not 2024 proceedings.

Pregunta de investigación

¿Hasta qué punto contextos aparentemente no relacionados alteran los valores y rasgos expresados por un LLM en cuestionarios psicológicos, y con qué eficacia distintas combinaciones de modelo, mensaje y persona gramatical permiten inducir deliberadamente una perspectiva objetivo?

Método

El estudio administra PVQ para diez valores de Schwartz, VSM para seis dimensiones culturales de Hofstede e IPIP para los Big Five. Cada ítem se consulta por separado y el modelo elige codiciosamente una letra entre las opciones. El cuestionario se repite con 50 permutaciones fijas del orden de respuestas. El efecto inesperado se estudia en GPT-3.5-turbo-0301 variando conversaciones, formatos y párrafos musicales; se aplican ANOVA, Tukey y comparaciones de cambio medio, orden de rangos e ipsativas. La controlabilidad se calcula como la media normalizada de dimensiones explícitamente inducidas menos la media de las restantes, para cuatro prompts: segunda o tercera persona en mensaje de sistema o usuario. La tabla compara modelos propietarios y abiertos, añade pruebas Welch, una ablación de intensidad, personajes ficticios y robustez a orden de opciones. La auditoría replica la lectura del PDF completo y revisa el repositorio en el commit inmediatamente posterior a arXiv v3.

Muestra: No hay participantes humanos ni una muestra poblacional. La unidad de inferencia es una ejecución determinista de un modelo bajo un contexto y una permutación de opciones. Para cada condición se usan hasta 50 permutaciones seleccionadas con una semilla fija; son transformaciones del mismo cuestionario y no réplicas independientes. El experimento inesperado principal usa GPT-3.5-turbo-0301; el apéndice compara seis modelos en formatos y la tabla de controlabilidad contiene 17 filas de modelo aunque texto y resumen afirman 16.

Hallazgos

  • El artículo formaliza una perspectiva como el contexto desde el que un modelo simula una conducta y usa la superposición como metáfora, no como mecanismo matemático del modelo.
  • PVQ mide diez valores personales agrupados en cuatro categorías; VSM seis dimensiones culturales; IPIP cinco dominios Big Five.
  • Cada pregunta se presenta de forma independiente, de modo que el modelo no ve respuestas anteriores del cuestionario.
  • Las respuestas se restringen a una letra mediante decodificación codiciosa y sesgo hacia los tokens de las opciones.
  • Se reutilizan 50 permutaciones fijas del orden de opciones para estimar una distribución de puntuaciones por contexto.
  • Las conversaciones simuladas cubren ajedrez, historia, poema, gramática y chiste, con GPT-4-0613 representando al interlocutor humano.
  • Los formatos son chat, TOML, Python, C++ y LaTeX; los párrafos de Wikipedia cubren clásica, heavy metal, hip-hop, jazz, reggae y gospel.
  • En conversaciones simuladas, el ANOVA reporta cambio significativo en los diez valores PVQ y las seis dimensiones VSM.
  • En formatos, el análisis reporta cambio significativo en todos los valores PVQ y VSM.
  • En párrafos musicales, todos los valores PVQ salvo poder cambian significativamente; en VSM quedan fuera distancia al poder y masculinidad.
  • El apéndice presenta variaciones análogas en las cinco puntuaciones IPIP, con excepciones señaladas por condición.
  • La mayor diferencia estandarizada reportada para GPT-3.5 es |d|=5,86, frente a |d|=0,53 en los estudios humanos seleccionados.
  • La menor estabilidad ipsativa de ChatGPT es r=0,05 entre chat y C++, frente a una media mínima humana seleccionada de r=0,59.
  • Los párrafos musicales producen cambios ipsativos menores, con mínimo r=0,77, que los formatos o conversaciones.
  • En seis modelos y cinco formatos, el modelo más estable depende de la métrica: OpenAssistant en cambio medio, GPT-3.5-0613 en orden y Upstage LLaMA-66B en ipsativa.
  • Zephyr-7B-beta es el menos estable de esos seis en orden e ipsativa, pero no en cambio medio.
  • La controlabilidad resta a la media normalizada de rasgos objetivo la media de los rasgos no objetivo; puede variar entre valores negativos y positivos.
  • El mejor PVQ a 50 permutaciones es GPT-3.5-0301 con 0,681 mediante segunda persona en sistema.
  • El mejor VSM a 50 permutaciones es Upstage LLaMA-66B-Instruct con 0,265 mediante tercera persona en usuario.
  • El mejor IPIP es GPT-3.5-0613 con 0,400 mediante tercera persona en sistema.
  • Ninguna combinación de segunda o tercera persona y sistema o usuario domina en todos los modelos y cuestionarios.
  • Los modelos casi incapaces de seguir la inducción, como StableLM y varios GPT-3 antiguos, tienen controlabilidad cercana a cero.
  • La tabla principal contiene 17 filas de modelos, aunque abstract y método hablan de 16; GPT-4 y Davinci se evalúan primero con solo diez permutaciones.
  • Para GPT-4 se selecciona la técnica más controlable tras diez permutaciones y solo esa se amplía a 50, mientras Davinci no se amplía.
  • En GPT-3.5 la controlabilidad aumenta monótonamente con intensidad en PVQ, VSM e IPIP; en OpenAssistant y StableVicuna solo en PVQ e IPIP.
  • Los personajes de Tolkien producen perfiles cualitativamente estereotípicos, pero se evalúan una sola vez y sin contraste humano.
  • En PVQ parece existir asociación entre mayor controlabilidad y menor varianza por orden de opciones; no se reproduce claramente en VSM o IPIP.
  • El código público selecciona únicamente el formulario masculino del PVQ pese a incluir también un archivo femenino.
  • El repositorio contemporáneo a arXiv v3 compila sintácticamente y contiene preguntas, scripts, licencia y análisis, pero no resultados ni logs.
  • La versión pública de evaluate.py importa un módulo ausente, requiere OPENAI_API_KEY al cargar y contiene rutas absolutas de la infraestructura de los autores.
  • El requirements.txt fija simultáneamente torch 2.0.0 y 1.13.1, duplica paquetes e instala Transformers desde una rama sin commit fijado.
  • El registro OpenReview corresponde a una submission de ICLR 2024 con decisión de rechazo; arXiv la clasifica como preprint de 2023.

Limitaciones

  • Las 50 observaciones son permutaciones de opciones del mismo sistema determinista, no participantes, seeds de muestreo ni réplicas independientes.
  • Las mismas permutaciones se aplican entre perspectivas, por lo que el diseño es pareado o de medidas repetidas, pero se analiza como grupos independientes.
  • El ANOVA de una vía, Tukey y las pruebas Welch no modelan la dependencia por pregunta y permutación; los p-valores pueden ser anticonservadores.
  • La comparación entre modelos elige primero el mejor prompt de cada modelo y luego lo contrasta, sin corregir la selección del máximo.
  • GPT-4 y Davinci reciben menos permutaciones que la mayoría, y GPT-4 se amplía después de seleccionar su condición ganadora.
  • La corrección Bonferroni cubre dimensiones dentro de un cuestionario, pero no toda la familia de experimentos, métricas, modelos y comparaciones exploradas.
  • Los tamaños de efecto Cohen d dependen de la variación entre órdenes de respuesta; no son conmensurables con la variación entre personas de estudios longitudinales.
  • Equiparar permutaciones con participantes para estabilidad de rangos e ipsativa carece de equivalencia sustantiva entre unidades de análisis.
  • Los estudios humanos se seleccionan de diseños, edades, duraciones, intervenciones y muestras distintos; no constituyen un control emparejado.
  • Afirmar que los cambios del LLM son mayores que los humanos excede lo que permiten escalas, denominadores y unidades no comparables.
  • El VSM 2013 fue diseñado para comparar medias de muestras culturales emparejadas y su manual indica que no sirve para comparar individuos ni un grupo único.
  • Aplicar fórmulas VSM a un solo modelo como si expresara cultura nacional compromete la validez de constructo de seis dimensiones y de sus resultados de controlabilidad.
  • No se evalúa fiabilidad interna, estructura factorial, invariancia, validez convergente, discriminante o criterial de PVQ, VSM o IPIP en LLM.
  • El estudio usa únicamente el formulario PVQ masculino y no analiza el efecto de la redacción de género.
  • Todas las pruebas están en inglés y no estudian diversidad lingüística o cultural pese al alcance cultural del argumento.
  • Los contextos 'ortogonales' fueron elegidos por los autores y no se valida con jueces que carezcan de asociaciones implícitas con valores.
  • Géneros musicales, formatos y temas tienen contenido y pragmática distintos; no puede atribuirse el efecto a una perspectiva latente específica.
  • Cada tema conversacional usa una única conversación generada y almacenada; tema, redacción concreta y trayectoria quedan confundidos.
  • Cinco temas, cinco formatos y seis géneros son una muestra de conveniencia pequeña y no preregistrada del universo de contextos.
  • La decodificación codiciosa con un solo token y logit bias mide preferencia local entre letras, no una respuesta natural del modelo.
  • Cada ítem se administra aislado; el diseño no evalúa coherencia dentro de una sesión ni persistencia conversacional.
  • La puntuación de controlabilidad puede aumentar por reducir dimensiones no objetivo aunque el rasgo objetivo apenas suba.
  • Promediar rasgos no objetivo asume comparabilidad e independencia entre escalas y oculta perfiles muy distintos bajo el mismo escalar.
  • No se proporcionan intervalos de confianza de controlabilidad que reflejen selección de prompt, ítems, contextos y modelos.
  • La inferencia de que RLHF desplazó el control del usuario al sistema compara snapshots opacos de OpenAI; otros cambios de datos, arquitectura o serving no están controlados.
  • La tabla principal mezcla familias, tamaños, interfaces y disponibilidad de system prompt, por lo que las diferencias no identifican efectos causales del modelo.
  • El análisis inesperado principal se concentra en GPT-3.5-0301; la comparación de seis modelos se limita a cambios de formato.
  • Los modelos y endpoints de OpenAI están retirados o modificados, lo que impide una reproducción prospectiva exacta.
  • La metáfora cuántica de superposición es ilustrativa y puede sugerir una estructura formal que el estudio no estima.
  • Los experimentos observan salidas condicionadas; no inspeccionan activaciones, representaciones, circuitos ni distribución interna de perspectivas.
  • La extrapolación desde cuestionarios de valores a conocimiento, capacidades y benchmarks generales no se prueba experimentalmente.
  • No hay participantes humanos que juzguen si los perfiles inducidos son coherentes, realistas, culturalmente adecuados o estereotípicos.
  • La sección ética plantea pluralismo, derechos y alineamiento, pero no mide daño, estereotipos, sesgo o efectos diferenciales.
  • El manuscrito no tiene una sección de limitaciones que reconozca pseudorreplicación, uso individual de VSM o no equivalencia con humanos.
  • El commit de código cercano a arXiv v3 no está etiquetado como release y hubo una corrección de correlaciones un mes antes, lo que vuelve importante fijar la revisión exacta.
  • evaluate.py importa evaluate_political_compass_csv.py, archivo ausente del árbol, por lo que el entrypoint falla antes de ejecutar aun cuando esa tarea no se use.
  • evaluate.py exige OPENAI_API_KEY al importarse y muestra una versión parcialmente enmascarada, una práctica innecesaria de exposición de credenciales.
  • Las rutas de cache y checkpoints están codificadas para dos máquinas de los autores y requieren edición manual.
  • El entorno no es resoluble tal como está por versiones incompatibles de torch, dependencias duplicadas y una instalación no fijada de Transformers.
  • No se publican outputs, alignments.json, conversaciones completas de todas las condiciones, logs, costes ni un script único que regenere cada tabla.
  • No hay CI ni pruebas end-to-end; compileall solo confirma sintaxis y no detecta imports, dependencias, APIs o rutas rotas.
  • La licencia MIT conserva únicamente el copyright original de Dan Hendrycks, reflejo del origen MMLU, sin aclarar explícitamente la autoría de las modificaciones del estudio.
  • La submission fue rechazada en ICLR; debe leerse como preprint abierto, no como artículo aceptado en proceedings.

Qué no demuestra

  • No demuestra que un LLM tenga personalidad, valores, identidad, experiencia subjetiva o preferencias propias.
  • No demuestra que exista una superposición interna de perspectivas en sentido matemático o neurocomputacional.
  • No identifica cuántas perspectivas existen, cómo se representan ni si son discretas, continuas o composicionales.
  • No demuestra que una puntuación de cuestionario corresponda al mismo constructo en humanos y LLM.
  • No demuestra que VSM mida cultura en un modelo individual.
  • No demuestra que los LLM cambien más que las personas en una escala comparable.
  • No establece estabilidad test-retest bajo muestreo, sesiones independientes o fechas distintas.
  • No establece generalización a otros idiomas, culturas, dominios, tareas abiertas o despliegues.
  • No demuestra que los contextos escogidos sean psicológicamente ortogonales a valores o personalidad.
  • No demuestra que los efectos se deban a perspectivas y no a tokenización, formato, asociaciones léxicas o sesgos de opción.
  • No demuestra coherencia entre respuestas dentro de una conversación, porque cada ítem se consulta por separado.
  • No demuestra que el prompt más controlable produzca una persona completa, estable o humanamente reconocible.
  • No demuestra que mayor controlabilidad sea beneficiosa, segura o deseable.
  • No demuestra que RLHF cause las diferencias entre snapshots de GPT-3.5.
  • No demuestra que un método de inducción sea universalmente superior.
  • No establece comparaciones justas entre modelos con interfaces, tamaños y números de permutación distintos.
  • No valida conocimiento o capacidad general de benchmarks distintos de los cuestionarios estudiados.
  • No demuestra ausencia de sesgo, estereotipos o daño al inducir perspectivas culturales.
  • No permite reproducir exactamente las tablas actuales con el entrypoint y los artefactos publicados sin reparaciones y servicios históricos.
  • No constituye evidencia de aceptación en ICLR 2024 ni de revisión por pares favorable.
  • No autoriza interpretar las cifras como diagnóstico psicológico, cultural, clínico o laboral.

Trazabilidad

Alcance: Texto completo

Versión: arXiv 2307.07870v3, 7 Nov 2023, 34 pages; paper-era code snapshot value_stability commit 70611f2b97bc7784b4882981ad23a04f60a4b08d

Fuente consultada: https://arxiv.org/pdf/2307.07870v3

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, venue-status, psychometric, VSM-level-of-analysis, experimental-design, statistical-independence, code-artifact, reproducibility and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4-0314
  • GPT-3.5-turbo-0301
  • GPT-3.5-turbo-0613
  • text-davinci-003
  • GPT-3.5-turbo-instruct-0914
  • Upstage LLaMA-2-70B-Instruct
  • Upstage LLaMA-66B-Instruct
  • Zephyr-7B-beta
  • OpenAssistant RLHF LLaMA-30B
  • StableLM 7B
  • LLaMA-65B
  • StableVicuna 13B
  • RedPajama INCITE 7B Chat
  • RedPajama INCITE 7B Instruct
  • Curie
  • Babbage
  • Ada
  • GPT-4-0613 como interlocutor simulado

Instrumentos y métricas

  • Portrait Values Questionnaire (PVQ)
  • Values Survey Module 2013 (VSM)
  • Goldberg IPIP representation of NEO-PI-R Big Five domains
  • Perspective controllability score
  • One-way ANOVA with Bonferroni threshold
  • Tukey HSD post-hoc tests
  • Welch independent-samples t-tests
  • Cohen's d
  • Pearson rank-order stability
  • Ipsative value-profile correlation
  • Variance over answer-order permutations

Datos utilizados

  • PVQ male-form questionnaire items bundled in the public repository
  • VSM 2013 24-item questionnaire
  • IPIP 50-item Big Five questionnaire
  • Five simulated-conversation topics
  • Five textual renderings of the questionnaire
  • First Wikipedia paragraphs for six music genres
  • Published aggregate results from five human longitudinal or priming studies

Evidencia y localización

  • Autoría, año y versión vigentes: arXiv 2307.07870: six named authors, submitted 15 Jul 2023, v3 dated 7 Nov 2023, classified as Preprint
  • Estado editorial: OpenReview forum 1FWDEIGm33: ICLR 2024 submission 9417, modified 11 Feb 2024; decision recorded as Reject
  • Fuente completa auditada: .cache/editorial-sources/article-091/source.pdf; arXiv 2307.07870v3; 34 pages; sha256 b73ac3e601b216016551a5b81cc0c1d73795b0498eb7a422419a1dab9f95ef8f
  • Metáfora y preguntas del trabajo: Full text pp. 1-3, Abstract and Introduction
  • PVQ, VSM e IPIP: Full text pp. 3-4, Section 3; pp. 16-18, Appendix A
  • Una pregunta por prompt y 50 permutaciones: Full text pp. 4-5, Section 3 and Figure 1
  • Definición de controlabilidad: Full text p. 5, Equation 1 and Figure 2
  • Conversaciones, formatos y párrafos musicales: Full text pp. 5-7, Section 4.1 and Figure 3
  • Significación reportada del cambio contextual: Full text p. 6, Section 4.1: ANOVA, Bonferroni and Tukey results
  • Resultados IPIP inesperados: Full text p. 32, Appendix Figure 13
  • Resultados principales de controlabilidad: Full text pp. 8-9, Section 4.2 and Table 1
  • Comparaciones Welch: Full text p. 28, Appendix Table 9
  • Comparación Cohen d con estudios humanos: Full text pp. 18-20, Appendix C.1 and Table 3
  • Analogía entre participantes y permutaciones: Full text p. 19, Appendix C.1; p. 21, Appendix C.3
  • Estabilidad de rangos: Full text pp. 19-21, Appendix C.2 and Table 4
  • Estabilidad ipsativa: Full text pp. 21-23, Appendix C.3 and Table 5
  • Comparación inesperada de seis modelos: Full text pp. 22-23, Appendix D and Table 6
  • Personajes ficticios: Full text pp. 24-25, Appendices E.1-E.2 and Figure 4
  • Gradualidad de inducción: Full text pp. 25-26, Appendix E.4 and Table 7
  • Sensibilidad al orden de opciones: Full text pp. 26-28, Appendix E.5, Table 8 and Figure 7
  • Ética y reproducibilidad declaradas: Full text pp. 9-10, Ethics Statement and Reproducibility
  • VSM no válido para individuos: Official VSM 2013 Manual, Section 2: not for comparing individuals; official Research and VSM guidance: requires matched samples from two or more societies
  • Repositorio y commit del artículo: https://gitlab.inria.fr/gkovac/value_stability commit 70611f2b97bc7784b4882981ad23a04f60a4b08d, 8 Nov 2023; checked 15 Jul 2026
  • Permutaciones idénticas y semilla fija: Paper-era public code evaluate.py lines 1633-1668: random.seed(1), shared sampled permutations
  • Formulario PVQ masculino: Paper-era public code evaluate.py lines 1420-1428; bar_viz.py lines 536-579
  • ANOVA sobre permutaciones como grupos: Paper-era public code visualization_scripts/bar_viz.py lines 742-803
  • Welch independiente sobre resultados compartidos: Paper-era public code models_stat_test.py lines 237-261
  • Import ausente y credencial: Paper-era public code evaluate.py lines 109-113; evaluate_political_compass_csv.py absent from git tree
  • Rutas internas: Paper-era public code evaluate.py lines 15-21 and 120; README asks user to edit llama_dir
  • Dependencias contradictorias: Paper-era public code requirements.txt lines 1-103: torch 2.0.0 and 1.13.1, duplicated packages; README installs Transformers from unfixed git HEAD
  • Ausencia de resultados reproducibles: Paper-era public repository tree: no results directories, alignments, generated conversations, CI or end-to-end test artifacts
  • Lectura y comprobación visual integral: All 34 pages rendered and inspected, including Figures 1-16, Tables 1-9, equations, appendices, prompts and references; checked 15 Jul 2026