Este trabajo estudia si cuatro LLM pequeños mantienen perfiles Big Five impuestos por prompt durante 20 intercambios narrativos y si la cuantización modifica esa estabilidad. Cada una de las 32 combinaciones binarias de rasgos se empareja con su opuesta. LLaMA3 8B Instruct, Mistral 7B Instruct v0.3, Gemma 7B Instruct v1.1 y Gemma2 9B Instruct se ejecutan con Ollama en FP16, GGUF Q8_0 y Q4_0; cada pareja y condición se repite 15 veces. En cada turno los agentes colaboran en una historia, repiten un autoinforme BFI de 44 ítems y producen narraciones analizadas con LIWC y embeddings nomic-embed-text-v1. Think2 solo añade al prompt narrativo: “Before writing the story, think twice what is your personality”. Los gráficos muestran que los perfiles opuestos de Gemma2 y LLaMA3 tienden a acercarse con el baseline y que Think2 conserva mejor su separación; los autores recomiendan Gemma2+Think2 en Q4_0 y LLaMA3+Think2 en Q8_0. El efecto no es uniforme: Mistral pierde gran parte de la relación inicial con y sin Think2, y Gemma 7B cae casi a cero en la métrica global bajo todas las precisiones. La afirmación de que la cuantización degrada invariablemente la personalidad tampoco queda aislada causalmente: FP16 también deriva, Q8_0 de LLaMA3 es relativamente estable y Think2 mejora asimismo FP16, por lo que la evidencia respalda un recordatorio genérico de persona más que una corrección específica de cuantización. La métrica llamada global correlation no es un coeficiente Pearson ordinario: concatena parejas, suma magnitudes de correlaciones positivas y negativas entre cinco OCEAN y características lingüísticas y aplica normalización min-max. Un valor cercano a 1 es relativo al conjunto comparado, no r=1. El artículo publica 24 figuras pero ninguna tabla de resultados numéricos, pruebas, intervalos o tamaños de efecto; tampoco especifica decodificación, scoring BFI, particiones de validación cruzada ni libera código o datos. Es evidencia exploratoria de deriva de cumplimiento de prompts extremos y de que un recordatorio puede reforzarlo en algunas familias; no demuestra personalidad psicológica, impacto causal general de la cuantización ni fiabilidad en usuarios o dispositivos reales.
Pregunta de investigación
¿Cómo cambian durante 20 turnos los perfiles Big Five asignados a agentes de rol construidos con LLM de 7-9B en FP16, Q8_0 y Q4_0; puede un recordatorio in-context llamado Think2 reducir esa deriva; y qué combinación de modelo, precisión y prompt conserva mejor las diferencias entre perfiles opuestos?