Stick to your Role! Stability of Personal Values Expressed in Large Language Models

Personas, identidad y agentes2024journals.plos.orgRevisión editorial aprobada

Título original: Stick to your role! Stability of personal values expressed in large language models

Autores: Grgur Kovač, Rémy Portelas, Masataka Sawayama, Peter Ford Dominey, Pierre-Yves Oudeyer

Palabras clave: Computation and Language, Artificial Intelligence, Machine Learning, Value Stability, Personal Values

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
15
Hallazgos
26
Limitaciones
14
Evidencias

Resumen editorial

Español

Kovač y coautores estudian una pregunta más precisa que si un LLM «posee valores»: hasta qué punto conserva el orden de los valores que expresa cuando cambia un contexto conversacional aparentemente ajeno. Administran el Portrait Values Questionnaire de 40 ítems (PVQ-40) a 21 modelos de seis familias, después de conversaciones sobre gramática, chistes, poesía, historia o ajedrez. En una condición cada modelo representa a 60 personajes de Tolkien o 50 personas famosas; en otra no recibe persona. El modelo evaluado conversa con otra instancia del mismo modelo y, para cada pregunta, se elige la letra A–F con mayor puntuación de siguiente token. Los scores se centran por participante y se agregan en los diez valores de Schwartz.

La estabilidad rank-order pregunta si las diferencias entre personas simuladas se ordenan igual entre dos temas: por ejemplo, si quienes expresan más tradición en un contexto siguen ocupando posiciones altas en otro. La estabilidad ipsativa pregunta si el orden de los diez valores dentro de una misma respuesta se conserva entre contextos. Son propiedades distintas. Un modelo puede mantener un perfil interno parecido y, a la vez, representar mal las diferencias entre personas; también puede obtener una correlación alta aunque el perfil sea sistemáticamente incorrecto. Por eso el resultado debe leerse como estabilidad de respuestas PVQ bajo este protocolo, no como evidencia de valores internos.

Con personas ficticias, el mayor rank-order medio es Mixtral-8x7B-Instruct (r=0,43), seguido por su variante 4-bit (0,30), Mistral-7B-Instruct-v0.2 (0,28), Qwen-72B (0,24) y GPT-3.5-1106 (0,20). Con personas reales, Mixtral-Instruct alcanza 0,50 y Qwen-72B 0,46. Los Llama-2 y Phi quedan cerca de cero. Sin persona, la estabilidad ipsativa es mayor: Mixtral-Instruct llega a 0,84, su variante cuantizada a 0,82, Qwen-72B a 0,73 y Zephyr a 0,62. Esto no implica equivalencia humana: los referentes humanos proceden de cambios longitudinales durante años, mientras aquí se correlacionan respuestas sintéticas tras cambios de tema. Los propios autores limitan la comparación a identificar modelos claramente por debajo de esos referentes.

En el único experimento de longitud, realizado con Mixtral-8x7B-Instruct y personajes ficticios, el rank-order cae de 0,42 con tres mensajes a 0,15 con 43; la estabilidad ipsativa permanece alta. El análisis de perfiles neutrales sugiere que las personas convergen hacia un perfil por defecto: conservar el orden intrapersonal no significa conservar identidades diferenciadas. Tres tareas conductuales creadas por los autores reproducen parcialmente la jerarquía de familias, pero con techos muy distintos. Religión es la más estable (máximos de 0,66–0,68), donación es moderada (máximo 0,31) y robo apenas llega a 0,16. Las correlaciones esperadas entre PVQ y donación aparecen para universalismo, benevolencia, poder y logro, pero ninguna supera 0,3.

La contribución sólida es metodológica: hace visible que una puntuación psicológica de contexto mínimo no caracteriza por sí sola el comportamiento posterior y separa estabilidad interpersonal de intrapersonal. La evidencia comparativa, sin embargo, es exploratoria. Los temas, personas y tareas son muestras de conveniencia; los contextos son generados por el propio modelo; las configuraciones de muestreo difieren entre familias; no se valida la estructura psicométrica del PVQ en LLM; y las explicaciones sobre tamaño, datos, SFT, DPO, RLHF, cuantización o alignment son observacionales y confundidas. La auditoría del código encuentra además tests t independientes sobre unidades emparejadas, promedios directos de correlaciones de Spearman y una corrección BH que incluye 21 diagonales además de las 210 comparaciones declaradas. La etiqueta oficial v1.0 no contiene data ni results; el repositorio posterior recupera los estímulos, pero no los outputs de los modelos. Por tanto, el estudio apoya que este protocolo detecta una fuerte sensibilidad contextual y diferencias descriptivas entre checkpoints; no demuestra valores internos, causalidad de entrenamiento, estabilidad conductual general ni reproducibilidad independiente de las cifras publicadas.

English

Kovač and coauthors study a narrower question than whether an LLM “has values”: whether the ordering of the values it expresses is preserved when an apparently unrelated conversational context changes. They administer the 40-item Portrait Values Questionnaire (PVQ-40) to 21 models from six families after conversations about grammar, jokes, poetry, history, or chess. In one condition, each model role-plays 60 Tolkien characters or 50 famous people; in another, it receives no persona. The tested model converses with a second instance of the same model, and each questionnaire response is the highest-scoring A–F next-token option. Scores are centered within participant and aggregated into Schwartz's ten values.

Rank-order stability asks whether differences among simulated people retain the same ordering across two topics: for example, whether personas expressing more Tradition in one context remain relatively high in another. Ipsative stability asks whether the ordering of the ten values within one participant is preserved across contexts. These are different properties. A model may retain a similar within-profile ordering while failing to preserve differences among personas; it may also obtain a high correlation while being systematically wrong about every persona. The results therefore concern PVQ response stability under this protocol, not evidence for internal values.

With fictional personas, the highest mean rank-order result is Mixtral-8x7B-Instruct (r=0.43), followed by its 4-bit variant (0.30), Mistral-7B-Instruct-v0.2 (0.28), Qwen-72B (0.24), and GPT-3.5-1106 (0.20). With real-world personas, Mixtral-Instruct reaches 0.50 and Qwen-72B 0.46. Llama-2 and Phi models remain near zero. Without personas, ipsative stability is higher: Mixtral-Instruct reaches 0.84, its quantized variant 0.82, Qwen-72B 0.73, and Zephyr 0.62. This does not establish human equivalence: the human references describe longitudinal change over years, whereas the model scores correlate synthetic answers after topic changes. The authors themselves restrict the comparison to identifying models clearly below those references.

In the only conversation-length experiment, conducted with Mixtral-8x7B-Instruct and fictional characters, rank-order stability falls from 0.42 at three messages to 0.15 at 43, while ipsative stability stays high. The neutral-profile analysis suggests convergence toward a default profile: preserving within-person ordering is not the same as preserving differentiated identities. Three author-created behavioral tasks partly reproduce the family ranking but have very different ceilings. Religion is the most stable (maxima of 0.66–0.68), Donation is moderate (maximum 0.31), and Stealing reaches only 0.16. Expected PVQ–Donation directions appear for Universalism, Benevolence, Power, and Achievement, but none of the correlations exceeds 0.3.

The paper's strongest contribution is methodological: it demonstrates why a minimal-context psychological score cannot by itself characterize later behavior and separates interpersonal from intrapersonal stability. The comparative evidence is nevertheless exploratory. Topics, personas, and tasks are convenience samples; contexts are generated by the tested model family; sampling configurations differ across families; PVQ measurement structure is not validated for LLMs; and explanations involving scale, data, SFT, DPO, RLHF, quantization, or alignment are observational and confounded. The code audit also finds independent-sample t-tests applied to matched units, raw averaging of Spearman correlations, and a BH implementation that includes 21 diagonal entries in addition to the 210 declared pairwise comparisons. The official v1.0 tag contains neither data nor results; the later repository restores input stimuli but still lacks model outputs. The study therefore supports strong contextual sensitivity and descriptive checkpoint differences under this protocol. It does not establish internal values, training causality, general behavioral stability, or independent reproducibility of the published numbers.

Pregunta de investigación

¿Hasta qué punto 21 LLM mantienen estable el orden interpersonal e intrapersonal de los valores que expresan cuando cambia el tema o la longitud de una conversación, con y sin personas simuladas, y se trasladan esas diferencias a tres tareas conductuales?

Método

Estudio experimental exploratorio. Para cada modelo se simulan conversaciones sobre cinco temas con otra instancia del mismo modelo y se administra por separado cada ítem del PVQ-40 o de una tarea downstream. En las condiciones con persona se usan 60 personajes de Tolkien y 50 personas famosas; en la condición sin persona se repiten permutaciones del orden de respuesta. Cada respuesta es la letra permitida con mayor score de siguiente token. Los autores calculan correlaciones de Spearman rank-order entre personas para cada valor y par de contextos, e ipsativas entre los diez valores de cada persona; después promedian correlaciones. Usan cinco seeds para los experimentos principales, comparaciones t por pares con BH, un experimento de longitud en un modelo, tres tareas conductuales y un análisis de 14 contextos en dos modelos y un seed. La auditoría editorial leyó y renderizó las 21 páginas, verificó PLOS ONE y arXiv v4, inspeccionó el tag GitLab v1.0 y el repositorio posterior, compiló el código y revisó la generación, el scoring y la inferencia estadística.

Muestra: Veintiún checkpoints de seis familias. En cada modelo, las condiciones con persona combinan cinco seeds, cinco temas, 50 o 60 personas y 40 ítems PVQ: 50.000 o 60.000 consultas. Sin persona se usan 50 permutaciones de opciones, cinco temas y 40 ítems: 10.000 consultas por modelo. Donación y robo tienen 100 prompts cada una; religión tiene cinco prompts en los datos liberados. El experimento de longitud usa solo Mixtral-8x7B-Instruct con 3, 7, 11, 19, 27, 35 y 43 mensajes; el de 14 contextos usa un seed y dos modelos.

Hallazgos

  • Con personajes ficticios, Mixtral-8x7B-Instruct obtiene el mayor rank-order medio (r=0,43), seguido por Mixtral-Instruct 4-bit (0,30), Mistral-Instruct-v0.2 (0,28), Qwen-72B (0,24), GPT-3.5-1106 (0,20) y GPT-3.5-0125 (0,15).
  • Con personas reales, Mixtral-8x7B-Instruct llega a r=0,50 y Qwen-72B a 0,46; los Llama-2 y Phi permanecen cerca de cero en ambas poblaciones.
  • Sin instrucción de persona, la estabilidad ipsativa es 0,84 para Mixtral-Instruct, 0,82 para su versión 4-bit, 0,73 para Qwen-72B y 0,62 para Zephyr; Mistral-Instruct-v0.2 obtiene 0,48 y Llama-70B-chat 0,47.
  • Los referentes longitudinales humanos usados son rank-order 0,57 entre 10–12 años y 0,66 entre 20–28, e ipsativos 0,66 y 0,59; el artículo reconoce que la comparación favorece a los LLM y solo permite una inferencia unidireccional.
  • En Mixtral-Instruct con personas ficticias, aumentar la conversación de 3 a 43 mensajes reduce el rank-order de 0,42 a 0,15; entre 35 y 43 apenas cambia de 0,166 a 0,162.
  • La estabilidad ipsativa se mantiene alta al alargar conversaciones; junto con el perfil neutral del apéndice, el patrón sugiere convergencia de personas hacia un perfil común, no conservación de identidades diferenciadas.
  • Religión es la tarea downstream más estable: Mistral-Instruct-v0.2 obtiene 0,66, Mixtral-Instruct 0,67 y Qwen-72B 0,68.
  • En donación, los máximos son 0,31 para Mixtral-Instruct, 0,28 para su versión 4-bit y 0,25 para GPT-3.5-1106.
  • Robo resulta mucho más difícil: el máximo reportado es aproximadamente 0,16 y las diferencias entre modelos se comprimen.
  • Las correlaciones entre valores PVQ y donación tienen las direcciones esperadas para universalismo y benevolencia, y las opuestas para poder y logro, pero ninguna supera 0,3.
  • En 14 contextos y un solo seed, la estabilidad media es 0,215 para Mistral-Instruct-v0.2 y 0,334 para Mixtral-Instruct; los contextos con mensajes iniciales más largos tienden a dar menor estabilidad.
  • Las jerarquías descriptivas favorecen con frecuencia a Mixtral, Mistral, Qwen y GPT-3.5 frente a Llama-2 y Phi, pero no son uniformes en todas las tareas ni identifican una causa.
  • El código usa cinco agregados de seed por modelo para los contrastes rank-order principales y tests t independientes, aunque seeds, temas y personas están emparejados entre modelos.
  • La función FDR incluye la diagonal de 21 p-valores unitarios: corrige 231 entradas, no las 210 comparaciones entre modelos que declara el texto; el efecto es conservador pero confirma una divergencia entre método descrito y ejecutado.
  • El tag v1.0 compila, pero ignora y no contiene data ni results; el estado posterior contiene los estímulos y personas, no los outputs brutos ni resultados necesarios para recomputar las figuras.

Limitaciones

  • «Estabilidad de valores» operacionaliza correlaciones de respuestas PVQ, no la existencia, intensidad o estabilidad de valores internos.
  • No se valida en LLM la estructura factorial, fiabilidad, invariancia, validez convergente, discriminante o criterial del PVQ-40.
  • El PVQ se responde mediante una elección A–F forzada por score de siguiente token; no mide una respuesta abierta ni conducta espontánea.
  • El rank-order mezcla diferenciación de personas y sensibilidad al contexto; una correlación alta conserva orden relativo, pero no demuestra exactitud del perfil.
  • Solo se usan cinco temas principales, breves y escritos a mano; no forman una muestra representativa de contextos de despliegue.
  • Cada conversación la genera otra instancia del mismo modelo, así que los checkpoints reciben contenidos diferentes y la comparación mezcla sensibilidad con conducta del interlocutor.
  • Las configuraciones no están estandarizadas: GPT usa temperatura 1, Zephyr 0,7 y muchos modelos Hugging Face usan do_sample=true con defaults dependientes de versión.
  • Los seeds controlan permutaciones de opciones, pero el código no fija los RNG globales de Python, NumPy o Torch para la generación estocástica.
  • Las poblaciones de Tolkien y personas famosas son muestras de conveniencia sin perfiles gold validados ni representatividad.
  • Los templates varían entre modelos base, chat con system y chat sin system; el control de Llama-2 no elimina todos los efectos de formato.
  • Se promedian directamente correlaciones de Spearman sin transformación Fisher z, ocultando su distribución por valor, contexto y persona.
  • Si una sola serie es constante, el código sustituye la correlación indefinida por 0; si ambas son constantes devuelve NaN. El paper no discute estas decisiones.
  • Los tests t rank-order comparan cinco medias de seed como muestras independientes, aunque modelos comparten seeds, temas y poblaciones; no se modela emparejamiento ni jerarquía.
  • Los contrastes ipsativos tampoco aprovechan el emparejamiento de las mismas permutaciones o personas entre modelos.
  • La implementación BH incluye 21 diagonales además de 210 comparaciones, y las matrices binarias no ofrecen p-valores, efectos o intervalos numéricos.
  • No hay preregistro ni corrección clara para las múltiples correlaciones exploratorias PVQ–donación.
  • La comparación humana no es conmensurable: años de desarrollo longitudinal frente a cambios inmediatos de tema en agentes sintéticos.
  • El experimento de longitud se limita a un modelo y personajes ficticios; el de 14 contextos usa un seed y dos modelos seleccionados.
  • Donación, religión y robo son instrumentos ad hoc sin validación, fiabilidad, análisis de dificultad o criterios externos.
  • El texto dice que religión contiene seis consultas, pero enumera cinco y el CSV liberado tiene cinco filas.
  • Las explicaciones sobre tamaño, datos, SFT, DPO, RLHF, cuantización y alignment comparan checkpoints no equivalentes y no identifican causalidad.
  • Las versiones GPT-3.5 son propietarias; no se conocen pesos, datos ni detalles de entrenamiento.
  • Solo se evalúa inglés, pese a que valores y personas tienen componentes culturales fuertes.
  • La declaración PLOS dice que code and data están disponibles, pero v1.0 omite data y results; el repositorio posterior tampoco publica outputs brutos.
  • Sin respuestas, manifest de runs, logs y resultados intermedios no pueden recomputarse de forma independiente barras, errores, tests o exclusiones.
  • No hay suite de tests; requirements duplica termcolor y tiktoken y depende de versiones antiguas y backends difíciles de reconstruir.

Qué no demuestra

  • No demuestra que los LLM posean valores personales, personalidad interna o un self persistente.
  • No demuestra que el PVQ sea una medida psicométricamente válida del constructo humano en un LLM.
  • No demuestra que Mixtral, Mistral, Qwen o GPT-3.5 sean globalmente más estables fuera de estos prompts, versiones y tareas.
  • No demuestra que un rank-order alto corresponda a una representación fiel de una persona concreta.
  • No demuestra equivalencia o superioridad respecto a humanos; los referentes longitudinales no son una prueba de equivalencia.
  • No demuestra que conversaciones largas siempre destruyan la coherencia de personas.
  • No demuestra que la estabilidad ipsativa alta preserve identidades diferenciadas; puede reflejar un perfil por defecto.
  • No demuestra que respuestas PVQ predigan conducta general; las relaciones con tareas ad hoc son pequeñas y variables.
  • No demuestra que SFT o DPO causen estabilidad, que RLHF la reduzca ni que alignment impida representar personajes controvertidos.
  • No demuestra que tamaño de dataset sea más importante que tamaño del modelo.
  • No demuestra un efecto causal de cuantización; solo observa dos pares Mixtral.
  • No establece un umbral suficiente para despliegue, seguridad o simulación social.
  • No permite verificar de forma independiente las cifras publicadas a partir del artefacto liberado.
  • No cubre otros idiomas, culturas, valores, contextos ni modelos posteriores.
  • No sustituye validación psicométrica, evaluación conductual longitudinal o auditoría de un caso de uso real.

Trazabilidad

Alcance: Texto completo

Versión: arXiv v4, 21-page extended version updated 28 August 2024; cross-checked against the PLOS ONE version published 26 August 2024, 19(8): e0309114, DOI 10.1371/journal.pone.0309114

Fuente consultada: https://arxiv.org/pdf/2402.14846

Revisión: Codex editorial review and methods/artifact audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Llama 2 base and chat: 7B, 13B and 70B (6 checkpoints)
  • Mistral-7B base, Mistral-7B-Instruct v0.1 and v0.2, and Zephyr-7B-beta (4 checkpoints)
  • Mixtral-8x7B base and instruct, each at 16-bit and 4-bit precision (4 checkpoints)
  • Phi-1 and Phi-2 (2 checkpoints)
  • Qwen-7B, Qwen-14B and Qwen-72B (3 checkpoints)
  • GPT-3.5-turbo-1106 and GPT-3.5-turbo-0125 (2 checkpoints)

Instrumentos y métricas

  • Portrait Values Questionnaire, 40-item version (PVQ-40)
  • Schwartz's ten basic personal values
  • Rank-order stability across simulated participants
  • Ipsative stability within simulated participants
  • Author-created Donation, Religion and Stealing tasks

Datos utilizados

  • 60 Tolkien characters selected mainly from Wikipedia page length and manually balanced
  • 50 real-world famous people taken from an online influential-people list
  • Five hand-written conversation starters: grammar, joke, poem, history and chess
  • PVQ male and female item variants
  • 100 Donation prompts and 100 Stealing prompts based on Tolkien races and names
  • Five Religion schedule prompts, despite the paper describing six
  • Fourteen-context extension with nine additional hand-written topics

Evidencia y localización

  • Publicación, DOI, fecha, abstract y disponibilidad: PLOS ONE 19(8): e0309114, published 26 Aug 2024, DOI 10.1371/journal.pone.0309114; official metadata, abstract and Data Availability
  • Diseño, conversaciones, PVQ y dos tipos de estabilidad: arXiv v4 full paper, Figure 1 and sections 3.1–3.2, pp. 1–4
  • Veintiún modelos y seis familias: arXiv v4 section 4.1, pp. 4–5
  • Rank-order, ipsativa y comparación humana: arXiv v4 sections 4.2–4.3 and Figures 4–5, pp. 5–6
  • Longitud y convergencia hacia perfil neutral: arXiv v4 section 4.4, Figures 6–7, pp. 5–7; Appendix D.2, pp. 16–17
  • Religión, donación, robo y relación PVQ–donación: arXiv v4 sections 4.5–4.6 and Figures 8–9, pp. 7–9; Appendix C, pp. 15–16
  • Catorce contextos, factores y limitaciones: arXiv v4 Figure 10 and sections How additional contexts, What influences, Limitations, pp. 8–11
  • Poblaciones, prompts, scoring y conteos: arXiv v4 Appendices B–C, pp. 14–16; current official repository input files audited 15 Jul 2026
  • Tests t y FDR descritos: arXiv v4 Appendix E and Figures 16–21, pp. 17 and 20–21
  • Spearman, promedios y series constantes: Official GitLab tag v1.0 commit e237b7ab7e69fe9053e78a49afb87bccf50ad158, visualization_scripts/data_analysis.py, audited 15 Jul 2026
  • Tests independientes y diagonal BH: Official GitLab tag v1.0 commit e237b7ab7e69fe9053e78a49afb87bccf50ad158, campaign_data_analysis.py, audited 15 Jul 2026
  • Muestreo y seeds: Official GitLab tag v1.0 model configs, evaluate.py and run_campaign_seeds.sh, audited 15 Jul 2026
  • Ausencia de inputs y resultados en v1.0: Official GitLab v1.0: 59 tracked files, data_files=0 and result_files=0 because .gitignore excludes data/* and results*; current master has stimuli but no paper result JSONs, audited 15 Jul 2026
  • Integridad visual del texto completo: arXiv v4 PDF SHA-256 babd4c09fdb9b6baaa6cc9d589d823abe431db0c153315923dfd84d7f69162b8; all 21 pages rendered and inspected 15 Jul 2026