Investigating the Personality Consistency in Quantized Role-Playing Dialogue Agents

Personas, identidad y agentes2024ACL AnthologyRevisión editorial aprobada

Autores: Yixiao Wang, Homa Fashandi, Kevin Ferreira

Palabras clave: model quantization, role-playing agents, personality consistency, Big Five model, edge computing, multi-turn dialogue, conversational AI

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
15
Hallazgos
35
Limitaciones
19
Evidencias

Resumen editorial

Español

Este trabajo estudia si cuatro LLM pequeños mantienen perfiles Big Five impuestos por prompt durante 20 intercambios narrativos y si la cuantización modifica esa estabilidad. Cada una de las 32 combinaciones binarias de rasgos se empareja con su opuesta. LLaMA3 8B Instruct, Mistral 7B Instruct v0.3, Gemma 7B Instruct v1.1 y Gemma2 9B Instruct se ejecutan con Ollama en FP16, GGUF Q8_0 y Q4_0; cada pareja y condición se repite 15 veces. En cada turno los agentes colaboran en una historia, repiten un autoinforme BFI de 44 ítems y producen narraciones analizadas con LIWC y embeddings nomic-embed-text-v1. Think2 solo añade al prompt narrativo: “Before writing the story, think twice what is your personality”. Los gráficos muestran que los perfiles opuestos de Gemma2 y LLaMA3 tienden a acercarse con el baseline y que Think2 conserva mejor su separación; los autores recomiendan Gemma2+Think2 en Q4_0 y LLaMA3+Think2 en Q8_0. El efecto no es uniforme: Mistral pierde gran parte de la relación inicial con y sin Think2, y Gemma 7B cae casi a cero en la métrica global bajo todas las precisiones. La afirmación de que la cuantización degrada invariablemente la personalidad tampoco queda aislada causalmente: FP16 también deriva, Q8_0 de LLaMA3 es relativamente estable y Think2 mejora asimismo FP16, por lo que la evidencia respalda un recordatorio genérico de persona más que una corrección específica de cuantización. La métrica llamada global correlation no es un coeficiente Pearson ordinario: concatena parejas, suma magnitudes de correlaciones positivas y negativas entre cinco OCEAN y características lingüísticas y aplica normalización min-max. Un valor cercano a 1 es relativo al conjunto comparado, no r=1. El artículo publica 24 figuras pero ninguna tabla de resultados numéricos, pruebas, intervalos o tamaños de efecto; tampoco especifica decodificación, scoring BFI, particiones de validación cruzada ni libera código o datos. Es evidencia exploratoria de deriva de cumplimiento de prompts extremos y de que un recordatorio puede reforzarlo en algunas familias; no demuestra personalidad psicológica, impacto causal general de la cuantización ni fiabilidad en usuarios o dispositivos reales.

English

This paper studies whether four small LLMs retain prompt-assigned Big Five profiles across 20 narrative exchanges and whether quantization changes that stability. Each of the 32 binary trait combinations is paired with its opposite. LLaMA3 8B Instruct, Mistral 7B Instruct v0.3, Gemma 7B Instruct v1.1, and Gemma2 9B Instruct are run through Ollama in FP16, GGUF Q8_0, and Q4_0; every pair and condition is repeated 15 times. At each turn, agents collaborate on a story, repeat a 44-item BFI self-report, and produce narratives analyzed with LIWC and nomic-embed-text-v1 embeddings. Think2 merely adds to the narrative prompt: “Before writing the story, think twice what is your personality.” The plots show that opposite Gemma2 and LLaMA3 profiles tend to converge under the baseline and remain more separated with Think2; the authors recommend Gemma2+Think2 at Q4_0 and LLaMA3+Think2 at Q8_0. The effect is not uniform: Mistral loses much of its initial relationship under both methods, while Gemma 7B falls close to zero on the global metric at every precision. The claim that quantization invariably degrades personality is also not causally isolated: FP16 drifts too, LLaMA3 Q8_0 is relatively stable, and Think2 improves FP16 as well, supporting a generic persona reminder more directly than a quantization-specific correction. The metric called global correlation is not an ordinary Pearson coefficient: it concatenates pairs, sums the magnitudes of positive and negative correlations between five OCEAN dimensions and linguistic features, then applies min-max normalization. A value near 1 is relative to the compared set, not r=1. The paper publishes 24 figures but no numeric result tables, tests, intervals, or effect sizes; it also omits decoding details, BFI scoring, cross-validation splits, and a code or data release. This is exploratory evidence of drift in adherence to extreme prompts and of reminder-based reinforcement for some model families; it does not establish psychological personality, a general causal effect of quantization, or reliability with real users or edge devices.

Pregunta de investigación

¿Cómo cambian durante 20 turnos los perfiles Big Five asignados a agentes de rol construidos con LLM de 7-9B en FP16, Q8_0 y Q4_0; puede un recordatorio in-context llamado Think2 reducir esa deriva; y qué combinación de modelo, precisión y prompt conserva mejor las diferencias entre perfiles opuestos?

Método

Los autores codifican cada dimensión OCEAN como adjetivo negativo o positivo y generan las 32 combinaciones binarias, organizadas en 16 parejas opuestas. Cada agente completa BFI y narra una historia; después, ambos miembros colaboran durante 20 turnos, ven la última respuesta contraria y repiten autoinforme y narración. Se comparan baseline y Think2, que añade una frase de reflexión sobre la personalidad. Cuatro modelos por tres precisiones y 16 parejas se repiten 15 veces. El análisis usa radares de puntuación OCEAN, regresión lineal con LIWC y embeddings para separar perfiles mediante validación cruzada y una métrica global normalizada basada en correlaciones entre puntuaciones iniciales y características narrativas.

Muestra: El estudio es completamente sintético. Su diseño cruza cuatro modelos de 7-9B, tres representaciones numéricas, dos prompts, 32 perfiles Big Five extremos agrupados en 16 parejas, 21 momentos de medición y 15 repeticiones. Los agentes interactúan solo con el perfil exactamente opuesto y escriben historias personales colaborativas. No hay usuarios, anotadores humanos, personajes naturales ni dispositivos periféricos evaluados; el artículo tampoco identifica el número final de narraciones utilizables tras posibles fallos de salida.

Hallazgos

  • Los perfiles se inducen mediante cinco adjetivos explícitos en el system prompt, uno por dimensión Big Five.
  • Las 32 combinaciones binarias cubren todos los patrones alto/bajo y se emparejan con su opuesto bit a bit.
  • El agente repite el BFI de 44 ítems en cada uno de los 20 turnos además de la medición inicial.
  • Think2 difiere del baseline por una sola instrucción de recordar la personalidad antes de escribir.
  • En los ejemplos Gemma2, las puntuaciones de perfiles opuestos se acercan tras 20 turnos con baseline y permanecen más separadas con Think2.
  • La separabilidad de embeddings suele ser alta desde el turno 0 y se mantiene mejor que LIWC.
  • Think2 eleva la exactitud de validación cruzada de Gemma2 y LLaMA3 en muchas condiciones visualizadas.
  • Para Gemma2, la correlación global baseline cae en FP16, Q8_0 y Q4_0, mientras Think2 conserva niveles relativos alrededor de 0,5-0,7.
  • Para LLaMA3, el baseline Q8_0 es más estable que FP16 y Q4_0, y Think2 aumenta especialmente FP16 y Q8_0.
  • Mistral pierde gran parte de la correlación tras el turno inicial en todas las precisiones; Think2 aporta mejoras pequeñas.
  • Gemma 7B cae casi a cero en la correlación global con baseline y Think2, por lo que el recordatorio no rescata todas las familias.
  • Los autores designan Gemma2+Think2 Q4_0 como mejor opción de cuatro bits y LLaMA3+Think2 Q8_0 como mejor opción de ocho bits.
  • La mejora de Think2 también aparece en FP16, indicando que no depende de la cuantización.
  • Los resultados se comunican mediante 24 figuras y descripción cualitativa, sin una tabla numérica que permita comparar todas las condiciones.
  • No se identifica un repositorio oficial de código, datos o salidas para recalcular las figuras.

Limitaciones

  • El estudio mide mantenimiento de instrucciones de persona, no personalidad psicológica del modelo.
  • Cada dimensión continua del Big Five se reduce a dos adjetivos extremos y se pierde toda gradación.
  • Algunos polos son valorativos o conceptualmente imprecisos, como antagonistic/agreeable y unconscientious/conscientious.
  • El texto denomina 00000 'extremely analytical', aunque ese código combina cierre a la experiencia, baja responsabilidad, introversión, antagonismo y estabilidad emocional.
  • Emparejar siempre con el perfil exactamente opuesto maximiza interferencia y no representa conversaciones ordinarias.
  • No hay condiciones con interlocutores similares, neutrales, humanos o perfiles continuos.
  • FP16 también muestra deriva y Think2 también lo mejora, por lo que el diseño no separa deriva conversacional de efecto causal de cuantización.
  • Q8_0 de LLaMA3 puede ser más estable que FP16, contradiciendo una relación monotónica simple entre menos bits y menos consistencia.
  • La afirmación de degradación invariable excede la heterogeneidad visible entre modelos y precisiones.
  • Think2 es un recordatorio de prompt genérico; no se compara con controles de igual longitud, reinyectar los rasgos, pedir pensar dos veces sin mencionar personalidad o resumir historial.
  • El beneficio puede proceder de priming directo hacia las etiquetas que también definen el objetivo, no de una reflexión estable.
  • El autoinforme BFI se administra mientras el system prompt contiene explícitamente los rasgos, favoreciendo respuestas por cumplimiento literal.
  • No se publican los 44 ítems, la clave de inversión, el cálculo por subescala ni el tratamiento de respuestas malformadas.
  • Los radares parecen usar totales sobre un eje común hasta 50 pese a que las subescalas BFI tienen distinto número de ítems; no se explica normalización.
  • Repetir el mismo cuestionario 21 veces dentro del contexto puede reforzar o contaminar las respuestas posteriores.
  • LIWC depende de un diccionario propietario y no se informa licencia, versión exacta del recurso ni categorías usadas.
  • Los embeddings de alta dimensión pueden capturar tema, estilo, modelo o plantilla además de rasgos.
  • La regresión no documenta variable objetivo, preprocesamiento, regularización, número de folds, agrupación ni particiones.
  • Si narraciones de una misma pareja o repetición aparecen en entrenamiento y prueba, la validación cruzada puede tener fuga de identidad; el artículo no permite descartarlo.
  • Se llama accuracy al resultado de regresión lineal sin definir formalmente cómo se convierte en porcentaje.
  • La métrica global concatena todas las parejas y oculta variación por rasgo, perfil y repetición.
  • Sumar magnitudes de correlaciones positivas y negativas elimina la dirección y puede premiar asociaciones contradictorias.
  • La normalización min-max hace que el valor dependa del conjunto comparado y no sea comparable como Pearson r entre figuras o estudios.
  • No se detallan intervalos, pruebas de hipótesis, p-valores, corrección por multiplicidad ni tamaños de efecto pese al uso repetido de 'significant'.
  • Las bandas y boxplots no se acompañan de valores, definición precisa del error o datos descargables.
  • Faltan temperatura, top-p, semilla, longitud exacta de historia, límites de tokens y política ante fallos.
  • Faltan nombres y hashes exactos de archivos GGUF, versiones de Ollama/ggml, hardware y configuración de ejecución.
  • No se mide memoria real, latencia, energía, calidad de respuesta ni rendimiento en un dispositivo periférico.
  • La elección 'optimal' usa solo estas métricas de consistencia, no el equilibrio completo entre recursos, utilidad, seguridad y calidad.
  • Solo se estudian cuatro modelos de 7-9B, una familia GGUF y dos niveles enteros, todos en inglés.
  • No hay evaluación humana de si las narraciones expresan el rasgo asignado o siguen siendo naturales, útiles y coherentes.
  • No hay usuarios, demografía, personajes realistas, tareas diversas ni interacciones distintas de historias colaborativas.
  • La afirmación de privacidad se apoya en ejecución local teórica; no se audita almacenamiento, logs, telemetría o amenazas.
  • No hay sección ética ni análisis de riesgos de personalidades antagonistas, imitación, manipulación o compañeros emocionales.
  • Sin código, datos y resultados numéricos, ninguna selección de modelo puede reproducirse de forma independiente.

Qué no demuestra

  • No demuestra que los LLM posean rasgos Big Five internos.
  • No demuestra que el autoinforme BFI sea válido cuando el sujeto es un LLM instruido con las respuestas esperables.
  • No demuestra que la cuantización degrade siempre o de forma monotónica la consistencia.
  • No aísla el efecto de cuantización del efecto de modelo, prompt, conversación y muestreo.
  • No demuestra que Think2 sea una mitigación específica de cuantización.
  • No demuestra que Think2 funcione en Gemma 7B ni de igual forma en todas las familias.
  • No demuestra significación estadística de las diferencias mostradas.
  • No permite interpretar la correlación global normalizada como r de Pearson.
  • No demuestra que separabilidad de embeddings equivalga a fidelidad de personalidad.
  • No demuestra que respuestas BFI consistentes predigan comportamiento fuera de la tarea narrativa.
  • No demuestra estabilidad ante conversaciones humanas, memoria larga, herramientas, RAG o entornos reales.
  • No demuestra generalización a otros modelos, bits, formatos de cuantización, idiomas o tareas.
  • No demuestra que Gemma2 Q4_0 o LLaMA3 Q8_0 sean óptimos para edge en coste o calidad global.
  • No demuestra mejoras de privacidad por sí mismas; solo presupone inferencia local.
  • No demuestra seguridad, satisfacción, confianza ni beneficio para usuarios.
  • No permite reconstruir las figuras sin artefactos experimentales.
  • No establece que las conclusiones se mantengan con versiones actuales de modelos y runtimes.

Trazabilidad

Alcance: Texto completo

Versión: EMNLP 2024 Industry Track final proceedings paper, pp. 239-255, DOI 10.18653/v1/2024.emnlp-industry.19, 17 pages; no official code or data release identified in the paper, ACL record, or targeted project search

Fuente consultada: https://aclanthology.org/2024.emnlp-industry.19.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, bibliographic, psychometric, quantization, metric-interpretation, experimental-design, reproducibility, privacy and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • LLaMA3 8B Instruct
  • Mistral 7B Instruct v0.3
  • Gemma 7B Instruct v1.1
  • Gemma2 9B Instruct
  • nomic-embed-text-v1 con Sentence Transformers, contexto 8192
  • Ollama como entorno de inferencia
  • GGUF FP16, Q8_0 y Q4_0 mediante ggml/llama.cpp

Instrumentos y métricas

  • Big Five Inventory (BFI), 44 ítems, autoadministrado al LLM en cada turno
  • Cinco dimensiones OCEAN codificadas como 32 perfiles binarios extremos
  • Linguistic Inquiry and Word Count 2015 (LIWC2015)
  • Embeddings nomic-embed-text-v1
  • Regresión lineal y exactitud de validación cruzada
  • Radares OCEAN con bandas de error
  • Métrica propia de correlación global con suma de magnitudes y normalización min-max

Datos utilizados

  • 32 perfiles OCEAN binarios definidos por prompt
  • 16 parejas de perfiles exactamente opuestos
  • 20 turnos de interacción más la medición inicial
  • 15 repeticiones por pareja, modelo, nivel de precisión y método
  • Narraciones personales y autoinformes generados por los propios LLM
  • No se usa ni publica un conjunto de datos humano

Evidencia y localización

  • Registro bibliográfico oficial: ACL Anthology 2024.emnlp-industry.19: 3 authors, EMNLP 2024 Industry Track, pp. 239-255, DOI 10.18653/v1/2024.emnlp-industry.19
  • Fuente completa auditada: .cache/editorial-sources/article-096/source.pdf; official ACL PDF; 17 pages; sha256 0cab9a312f18849a502a4af2dcf492e8b2a99c6d788bd57f1273d22519485899
  • Preguntas de investigación y afirmaciones: Full text pp. 239-240, Introduction
  • Cuatro modelos y tres precisiones: Full text p. 241, section 3.1
  • Treinta y dos perfiles binarios y dieciséis parejas: Full text p. 241, section 3.2 and Algorithm 1
  • Prompts de historias, interacción y BFI: Full text p. 242, Tables 1-2
  • Veinte turnos y autoevaluación repetida: Full text p. 242, section 3.3
  • LIWC y embeddings: Full text pp. 242-243, section 3.4
  • Definición exacta de Think2: Full text pp. 242-243, Narrative Task Prompt and section 3.5
  • Quince repeticiones por pareja: Full text p. 243, Experimental Results
  • Separación OCEAN con y sin Think2: Full text p. 243, Figure 2; Appendix pp. 250-251, Figures 5-11
  • Validación cruzada lingüística: Full text p. 244, Figure 3 and section 4.2; Appendix pp. 251-255, Figures 12-23
  • Construcción de global correlation: Full text p. 244, section 4.3 and Equation 1
  • Heterogeneidad entre familias: Full text pp. 244-245, Figure 4; Appendix pp. 249 and 255, section C and Figure 24
  • Elecciones recomendadas: Full text p. 245, sections 4.4-5
  • Limitaciones reconocidas: Full text p. 246, section 6
  • Ausencia de tablas numéricas y pruebas: All results in full text and appendices are figures or qualitative prose; no numeric results table, uncertainty table, hypothesis test or effect size is reported
  • Ausencia de artefacto reproducible: Paper and ACL metadata contain no project, code or data URL; targeted official GitHub/project search checked 15 Jul 2026
  • Comprobación visual integral: All 17 PDF pages rendered and visually inspected, including all 24 figures, two prompt tables, Algorithm 1, limitations and appendices; checked 15 Jul 2026