Scaling Personality Control in LLMs with Big Five Scaler Prompts

Inducción y control de rasgos2026arXivRevisión editorial aprobada

Autores: Gunhee Cho, Yun-Gyung Cheong

Palabras clave: Computation and Language, Multiagent Systems, Big Five personality traits, Prompt engineering

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
7
Hallazgos
14
Limitaciones
13
Evidencias

Resumen editorial

Español

Cho y Cheong presentan Big5-Scaler, una familia de instrucciones que escribe los cinco rasgos OCEAN como puntuaciones numéricas de x sobre n y pide al modelo que responda de acuerdo con ellas. Hay tres variantes: simple, con una frase por rasgo; specific, con seis descripciones de facetas por rasgo; y simspec, que combina ambos niveles. El trabajo estudia cinco cuestiones distintas, pero no todas con los mismos modelos ni el mismo diseño. Primero, Alpaca-7B responde el MPI de 1.000 ítems cuando se maximiza un solo rasgo y se compara con una condición neutral y tres baselines de prompting. Big5-Scaler simple obtiene la mayor media en apertura, responsabilidad, extraversión y amabilidad; en neuroticismo, la condición neutral (3,01) supera a todas las inducciones y la mejor variante Big5-Scaler queda en 2,73. Segundo, LLaMA3-8B, un modelo denominado Mistral-25B y Phi-4-14B contestan BFI, IPIP-NEO-120 y NEO-FFI mientras el rasgo objetivo varía de 0 a 90 y los otros cuatro quedan en 50. Muchas correlaciones entre puntuación indicada y cuestionario son altas, pero hay fallos claros, sobre todo en LLaMA: por ejemplo, apertura con IPIP bajo prompt simple r=-0,235, responsabilidad con prompt specific r=0,032 y apertura con BFI simple r=0,486. Estas pruebas miden si el modelo reproduce en un autoinforme instrucciones que ya nombran y describen el mismo constructo; no son una validación independiente en conducta abierta. Tercero, se generan diálogos de 20 turnos entre agentes con perfiles aleatorios. Tres jueces LLM aciertan cuál de dos agentes expresa más un rasgo entre 35,4% y 47,4%, frente al 33,3% esperado al elegir entre A, B o igual; el artículo no aporta tamaño de muestra, intervalos, pruebas ni evaluación humana para esta tarea. Cuarto, se compara la concatenación de los nueve primeros turnos de cada agente con el décimo: el coseno es 0,999 para los tres modelos, BERTScore queda entre 0,480 y 0,537 y PersonaCLR entre 0,789 y 0,828. Esa semejanza textual o estilística no identifica por sí sola estabilidad de rasgo, y el coseno casi perfecto carece de especificación suficiente para interpretarlo. Quinto, 17 estudiantes de posgrado coreanos de NLP completan IPIP-NEO-120; sus scores se convierten en prompts y el modelo vuelve a contestar el mismo inventario. Los RMSE publicados, 1,785–1,822, mejoran solo modestamente un azar aproximado de 2,0, sin incertidumbre ni contraste estadístico. Un análisis adicional crea 50 agentes por combinación de modelo, tipo de prompt y escala n en {10,25,50,100}; Phi-4-14B, simple, n=10 logra el menor RMSE medio (21,587), apenas 0,020 mejor que el mismo modelo con n=50. La afirmación narrativa de que n=10 gana de forma consistente tiene una excepción en Mistral-specific, cuyo mejor promedio es n=100, y varias excepciones por cuestionario. El artículo aporta evidencia útil de control de respuestas de cuestionario y señales lingüísticas mediante prompting explícito, pero no demuestra personalidad interna, equivalencia humana ni fidelidad individual alta.

English

Cho and Cheong present Big5-Scaler, a family of instructions that encodes the five OCEAN traits as numerical x-out-of-n scores and asks a model to respond accordingly. Three variants are tested: simple, with one sentence per trait; specific, with six facet descriptions per trait; and simspec, combining both levels. The paper studies five different questions, not all with the same models or design. First, Alpaca-7B answers the 1,000-item MPI while one trait is maximized and is compared with a neutral condition and three prompting baselines. The simple Big5-Scaler prompt has the highest mean for openness, conscientiousness, extraversion, and agreeableness; for neuroticism, however, neutral (3.01) exceeds every induction and the best Big5-Scaler variant reaches 2.73. Second, LLaMA3-8B, a model labelled Mistral-25B, and Phi-4-14B answer the BFI, IPIP-NEO-120, and NEO-FFI while the target trait varies from 0 to 90 and the other four remain at 50. Many correlations between assigned and questionnaire scores are high, but there are clear failures, especially for LLaMA: openness under the IPIP simple prompt is r=-0.235, conscientiousness under the specific prompt is r=0.032, and BFI openness under the simple prompt is r=0.486. These tests assess whether a model reproduces explicit construct instructions in a self-report instrument that measures the same construct; they are not independent validation in open behavior. Third, the authors generate 20-turn dialogues between randomly profiled agents. Three LLM judges identify which of two agents expresses more of a trait with scores from 35.4% to 47.4%, against 33.3% expected when choosing A, B, or equal; the paper does not report the sample size, uncertainty, tests, or human evaluation for this task. Fourth, the concatenated first nine utterances of each agent are compared with the tenth: cosine similarity is 0.999 for all three models, BERTScore ranges from 0.480 to 0.537, and PersonaCLR from 0.789 to 0.828. Textual or stylistic similarity alone does not identify trait stability, and the near-perfect cosine lacks enough specification to interpret. Fifth, 17 Korean NLP graduate students complete IPIP-NEO-120; their scores become prompts and the model answers the same inventory. Published RMSE values of 1.785–1.822 only modestly improve on an approximate random value of 2.0, without uncertainty or a statistical comparison. An additional analysis creates 50 agents for each model, prompt type, and n in {10,25,50,100}; Phi-4-14B with the simple prompt and n=10 has the lowest average RMSE (21.587), only 0.020 below the same model at n=50. The narrative claim that n=10 wins consistently has an exception for Mistral-specific, whose best average is n=100, and several questionnaire-level exceptions. The paper provides useful evidence that explicit prompts control questionnaire answers and some linguistic signals, but it does not establish internal personality, human equivalence, or high-fidelity individual imitation.

Pregunta de investigación

¿Puede una instrucción sin entrenamiento adicional, que expresa los cinco rasgos Big Five mediante valores numéricos y descripciones de distinto detalle, controlar proporcionalmente las respuestas de LLM, producir señales distinguibles y consistentes en diálogo y aproximar perfiles humanos?

Método

Evaluación en cinco bloques: inducción de un rasgo en Alpaca-7B con MPI y baselines; correlación entre diez intensidades asignadas y tres cuestionarios en tres LLM; diálogos de 20 turnos juzgados por tres LLM; similitud entre los nueve primeros turnos y el décimo mediante coseno, BERTScore y PersonaCLR; y reproducción de los IPIP-NEO-120 de 17 participantes. Un análisis factorial de diseño adicional genera 50 agentes por combinación de tres modelos, tres prompts y cuatro escalas, normaliza a 100 y compara RMSE.

Muestra: Alpaca-7B para el benchmark de inducción; tres modelos abiertos para escalado, diálogo y consistencia; diez niveles del rasgo objetivo por combinación en el análisis correlacional; 20 turnos por diálogo, diez de cada agente, aunque no se publica cuántos diálogos; 50 agentes aleatorios por combinación en el análisis de escala; y 17 estudiantes de posgrado coreanos de NLP para imitación humana. No se informa número de ejecuciones, seeds, distribución demográfica detallada ni tamaño por condición de diálogo.

Hallazgos

  • El prompt simple supera los baselines en cuatro de cinco medias del MPI, pero no en neuroticismo, donde la condición neutral es la más alta.
  • La mayoría de las correlaciones entre score indicado y score de cuestionario son altas para Mistral y Phi-4; LLaMA contiene varias relaciones débiles, no significativas o una negativa.
  • Los jueces LLM distinguen perfiles en diálogo por encima del azar, pero la mejora absoluta va de 2,1 a 14,1 puntos y carece de evaluación humana e incertidumbre.
  • PersonaCLR se sitúa en 0,789–0,828 y BERTScore en 0,480–0,537; el coseno reportado es exactamente 0,999 en los tres modelos.
  • La imitación de 17 perfiles humanos obtiene RMSE 1,785–1,822 frente a un azar aproximado de 2,0, una ventaja pequeña no contrastada.
  • Phi-4-14B con prompt simple y n=10 tiene el menor RMSE medio de la Tabla 7, pero prácticamente empata con n=50 y no todos los subcasos favorecen escalas bajas o prompts simples.
  • Los ejemplos cualitativos muestran diferencias estereotípicas congruentes con apertura, amabilidad y neuroticismo, sin evaluación sistemática independiente.

Limitaciones

  • La validación principal reutiliza cuestionarios del mismo constructo que el prompt nombra y describe explícitamente; existe contaminación del criterio, demanda y posibilidad de responder por reconocimiento semántico.
  • No hay condición de control que separe obediencia a números, conocimiento de ítems y expresión conductual de rasgos en tareas ajenas al cuestionario.
  • Las correlaciones se calculan con solo diez niveles por rasgo, sin repeticiones ni intervalos; se publican muchos tests sin corrección por multiplicidad y p=0,000 en vez de valores acotados.
  • El número de diálogos, perfiles, repeticiones y unidades evaluadas no se informa; tampoco hay CIs, tests, acuerdo entre jueces o protocolo de evaluación completo.
  • Los evaluadores del diálogo son LLM y pueden compartir los mismos estereotipos explícitos del prompt; no hay evaluación humana ciega.
  • Comparar contenido de nueve turnos con un décimo mezcla tema, vocabulario, memoria y estilo con personalidad. No se define con precisión el coseno que produce 0,999 ni se valida PersonaCLR para este uso en inglés.
  • El benchmark humano tiene solo 17 estudiantes coreanos de NLP, sin demografía, reclutamiento, consentimiento, aprobación ética, exclusiones ni análisis de privacidad descritos.
  • El azar humano de RMSE≈2,0 se presenta como aproximación sin procedimiento, distribución, intervalo ni prueba frente a los RMSE 1,785–1,822.
  • No se publican IDs exactos de los checkpoints, seeds, fechas, hardware, número de runs, errores de formato, refusals ni código y datos para reproducir el estudio.
  • El nombre Mistral-25B no se reconcilia con la referencia citada de Mistral 7B; la Tabla 5 cambia además los modelos a Mistral-14B y Phi4-25B, invirtiendo sus tamaños declarados.
  • La conclusión de que n=10 gana siempre contradice Mistral-specific, cuyo menor RMSE medio aparece en n=100, y numerosas celdas por cuestionario.
  • La ventaja media de Phi-4 simple n=10 sobre n=50 es 0,020 puntos normalizados, sin estimación de ruido que permita atribuir significado a la diferencia.
  • Varias descripciones de facetas son psicométricamente imprecisas o contienen errores: straightforwardness se describe como perdón, impulsiveness como inestabilidad emocional y aparecen self-disciplinel y compilance.
  • El estudio asume rasgos estáticos, usa conversaciones cortas y temas prefijados y no evalúa persistencia longitudinal, cambio contextual, seguridad, utilidad o efectos en usuarios.

Qué no demuestra

  • No demuestra que el modelo posea una personalidad interna, estable o equivalente a la humana.
  • No demuestra control proporcional general fuera de autoinformes que repiten el vocabulario del prompt.
  • No demuestra imitación individual de alta fidelidad: la mejora frente al azar aproximado es pequeña y no está contrastada.
  • No demuestra consistencia psicológica a partir de similitud textual o estilística entre turnos.
  • No permite afirmar que prompt simple o escala 10 sean óptimos para todos los modelos, rasgos, instrumentos o tareas.
  • No valida usos clínicos, educativos, de selección, simulación social o sustitución de participantes humanos.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2508.06149v1 (8 August 2025)

Fuente consultada: https://arxiv.org/pdf/2508.06149

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • Alpaca-7B
  • LLaMA3-8B (exact checkpoint not reported)
  • Mistral-25B as named by the paper (exact model unresolved; cited reference is Mistral 7B)
  • Phi-4-14B (exact checkpoint not reported)
  • GPT-4o-mini as dialogue evaluator (snapshot not reported)
  • Claude 3.5 Haiku as dialogue evaluator (snapshot not reported)
  • DeepSeek-Chat as dialogue evaluator (snapshot not reported)
  • xlm-roberta-base adaptation for PersonaCLR

Instrumentos y métricas

  • Machine Personality Inventory, reported as 1,000 items
  • Big Five Inventory
  • IPIP-NEO-120
  • NEO Five-Factor Inventory
  • Pearson correlation
  • LLM three-way trait identification
  • Cosine similarity
  • Sentence-BERT similarity
  • PersonaCLR adapted to English
  • Root mean squared error

Datos utilizados

  • Machine Personality Inventory from Jiang et al. (2023)
  • BFI, IPIP-NEO-120 and NEO-FFI questionnaire items
  • Generated 20-turn dialogues over ten predefined topics
  • IPIP-NEO-120 responses from 17 Korean NLP graduate students
  • Naro Utterance dataset used by the referenced PersonaCLR adaptation

Evidencia y localización

  • Definición de Big5-Scaler, escalas y tres tipos de prompt: arXiv v1, pp. 3–4, sections 3.2–3.3
  • Modelos, parámetros y diseño de inducción MPI: arXiv v1, pp. 4–5, sections 4 and 4.1
  • Diseño proporcional con tres cuestionarios y diez niveles: arXiv v1, p. 5, section 4.2
  • Diálogos, jueces LLM y métrica de consistencia: arXiv v1, pp. 5–6, sections 4.3–4.4
  • Muestra humana de 17 participantes y RMSE: arXiv v1, p. 6, section 4.5
  • Scores MPI, correlaciones y excepciones por rasgo: arXiv v1, pp. 6–7, sections 5.1–5.2 and Tables 1–2
  • Identificación de perfiles en diálogo: arXiv v1, pp. 6–7, section 5.3 and Table 3
  • Coseno, BERTScore y PersonaCLR: arXiv v1, pp. 7–8, section 5.4 and Table 4
  • Imitación humana y etiquetas de modelo inconsistentes: arXiv v1, pp. 7–8, section 5.5 and Table 5
  • Análisis de 50 agentes por combinación y afirmaciones sobre escala: arXiv v1, p. 8 and p. 18, section 6 and Table 7
  • Limitaciones reconocidas por los autores: arXiv v1, p. 9, section 8
  • Contenido exacto y errores de los prompts: arXiv v1, pp. 12–16, Appendices A–B and Figures 2
  • Curvas y ejemplos cualitativos de diálogo: arXiv v1, pp. 17 and 19, Figures 3–5