Evaluating and Inducing Personality in Pre-trained Language Models

Inducción y control de rasgos2023NeurIPS ProceedingsRevisión editorial aprobada

Autores: Guangyuan Jiang, Manjie Xu, Song-Chun Zhu, Wenjuan Han, Chi Zhang, Yixin Zhu

Palabras clave: Language Models, Personality Assessment, Machine Behavior, Psychometric Studies, Big Five, Machine Personality Inventory (MPI)

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
6
Hallazgos
6
Limitaciones
7
Evidencias

Resumen editorial

Español

El artículo propone el Machine Personality Inventory (MPI), una conversión de ítems Big Five de IPIP/IPIP-NEO y BFI-S en preguntas de opción múltiple para describir patrones de respuesta de modelos, y Personality Prompting (P²), una cadena de prompts para aumentar o reducir un rasgo objetivo. Se comparan seis sistemas: BART-large-MNLI, GPT-Neo 2.7B, GPT-NeoX 20B, T0++ 11B, Alpaca 7B y text-davinci-003, etiquetado como GPT-3.5 175B. Cada modelo responde versiones de 120 y aproximadamente 1.000 ítems a temperatura cero con plantillas adaptadas a su formato. Para cada rasgo se calcula la media OCEAN y la desviación estándar entre ítems; esta desviación se interpreta como «consistencia interna» y se contrasta descriptivamente con 619.150 respuestas humanas del IPIP-NEO-120. Alpaca y GPT-3.5 producen dispersiones y medias más próximas a las referencias humanas que los tres modelos base, aunque el estudio no aplica alfa, omega, test-retest, análisis factorial ni equivalencia de medida. P² se prueba principalmente sobre GPT-3.5: parte de una instrucción simple, incorpora palabras descriptivas de la literatura psicológica y pide al propio modelo redactar un retrato más detallado. En MPI eleva el rasgo objetivo respecto al prompt neutral, pero también altera rasgos no objetivo y no supera uniformemente a los dos baselines. La validación externa usa cinco viñetas y juicios comparativos de 100 participantes de Prolific. P² obtiene altas tasas de reconocimiento para apertura y extraversión positivas y negativas, pero la inducción de baja responsabilidad solo alcanza 0,45, por debajo del azar nominal. El apéndice muestra que Alpaca separa peor los rasgos y que para GPT-3.5 las paráfrasis del prompt cambian los resultados. La evidencia respalda que determinados prompts controlan patrones de cuestionario y texto en una instantánea concreta; no valida una personalidad interna, estable o equivalente a la humana.

English

The paper introduces the Machine Personality Inventory (MPI), which converts Big Five items from IPIP/IPIP-NEO and BFI-S into multiple-choice questions for describing model response patterns, and Personality Prompting (P²), a prompt chain intended to increase or decrease a target trait. Six systems are compared: BART-large-MNLI, GPT-Neo 2.7B, GPT-NeoX 20B, T0++ 11B, Alpaca 7B, and text-davinci-003, labelled GPT-3.5 175B. Each model answers 120-item and roughly 1,000-item versions at temperature zero using format-specific templates. For every trait, the study computes the mean OCEAN score and the standard deviation across items; it treats this deviation as “internal consistency” and descriptively compares it with 619,150 human IPIP-NEO-120 responses. Alpaca and GPT-3.5 yield dispersions and means closer to the human references than the three base models, but the study does not estimate alpha, omega, test-retest reliability, factor structure, or measurement equivalence. P² is tested primarily on GPT-3.5. It starts from a simple instruction, adds trait words from psychological literature, and asks the same model to write a more detailed portrait. On MPI it raises the target score relative to a neutral prompt, but it also shifts non-target traits and is not uniformly better than either baseline. External validation uses five vignettes and comparative judgments from 100 Prolific participants. P² receives high recognition rates for positive and negative openness and extraversion, but negative conscientiousness reaches only 0.45, below nominal chance. The appendix shows weaker trait separation on Alpaca and meaningful sensitivity to GPT-3.5 prompt paraphrases. The evidence supports prompt-controlled questionnaire and text patterns in particular model snapshots; it does not validate an internal, stable, or human-equivalent personality.

Pregunta de investigación

¿Pueden inventarios Big Five convertidos a opción múltiple describir cuantitativamente patrones de respuesta de LLM y puede una cadena de prompting inducir de forma reconocible niveles positivos o negativos de cada rasgo?

Método

Estudio en dos etapas. MPI transforma ítems IPIP/IPIP-NEO y BFI-S en preguntas de cinco opciones, con versiones de 120 y cerca de 1.000 ítems; seis modelos responden a temperatura cero mediante plantillas específicas y se comparan medias y desviaciones estándar OCEAN con estadísticas humanas. Después, P² genera un retrato a partir de una instrucción de rasgo, descriptores psicológicos y autoprompting; se compara en GPT-3.5 con prompting ingenuo y búsqueda de tres palabras. La transferencia se evalúa con cinco viñetas, versiones positiva, neutral y negativa y juicios binarios de participantes humanos. El apéndice añade P² en Alpaca y cinco paráfrasis generadas por GPT-4.

Muestra: Seis modelos en la evaluación MPI. La inducción principal se ejecuta sobre text-davinci-003 y el apéndice añade Alpaca 7B; GPT-4 solo produce cinco paráfrasis. La evaluación humana reúne 100 participantes de Prolific (67 mujeres, edad media 42,8 años), divididos en 50 conjuntos de respuestas para P² y 50 para el baseline de palabras.

Hallazgos

  • En MPI-120, Alpaca y GPT-3.5 presentan desviaciones estándar más próximas a las referencias humanas en los cinco rasgos; BART, GPT-Neo y GPT-NeoX muestran mayor dispersión, mientras T0++ produce perfiles muy extremos y consistentes.
  • En GPT-3.5, P² eleva frente al neutral apertura de 3,50 a 4,54, responsabilidad de 3,83 a 4,92, extraversión de 4,00 a 4,58, amabilidad de 3,58 a 5,00 y neuroticismo de 3,12 a 3,75.
  • La inducción no queda aislada al factor objetivo: varios prompts aumentan simultáneamente responsabilidad y amabilidad o reducen neuroticismo, por lo que el control de dimensiones no está plenamente disentangled.
  • P² supera claramente a los baselines en apertura y amabilidad, empata el score de extraversión, queda ligeramente por debajo del mejor baseline en responsabilidad y produce mayor neuroticismo; por tanto, su ventaja no es uniforme.
  • En las viñetas, las tasas de reconocimiento P² positiva/negativa son 0,77/0,90 para apertura, 0,73/0,45 para responsabilidad, 0,90/0,92 para extraversión, 0,88/0,84 para amabilidad y 0,68/0,74 para neuroticismo.
  • Alpaca responde peor a P² y mezcla más las dimensiones. Las cinco paráfrasis cambian los scores: suelen igualar o empeorar apertura, responsabilidad, extraversión y amabilidad, mientras algunas aumentan neuroticismo.

Limitaciones

  • La desviación estándar entre ítems se denomina consistencia interna, pero no es un coeficiente psicométrico de fiabilidad; no se calculan alfa, omega, test-retest, estructura factorial, validez convergente ni intervalos de incertidumbre.
  • Las plantillas se adaptan manualmente a cada arquitectura, de modo que capacidad, seguimiento de formato, tamaño y alineamiento se confunden con el supuesto rasgo.
  • La comparación humana usa promedios de una base histórica y no demuestra invariancia ni equivalencia entre respuestas de personas y tokens de modelos.
  • La inducción principal se limita a text-davinci-003, una instantánea cerrada, y P² usa el conocimiento del mismo modelo para redactar el prompt; la prueba en Alpaca muestra una generalización bastante más débil.
  • La validación externa contiene una sola viñeta por rasgo y juicios relativos sobre pocas respuestas. El texto informa 15 respuestas pero 10 preguntas binarias y no reporta significación, intervalos ni acuerdo entre evaluadores.
  • El estudio se realiza en inglés, a temperatura cero y sin diálogos multivuelta, repetición temporal, tareas operativas o medición de efectos reales sobre usuarios.

Qué no demuestra

  • No demuestra que un LLM tenga personalidad, conciencia, emociones, identidad o rasgos internos; los datos son respuestas condicionadas a ítems y prompts.
  • No valida MPI como instrumento psicométrico equivalente a IPIP-NEO en humanos ni hace comparables directamente sus puntuaciones.
  • No prueba que la personalidad sea una capacidad emergente ni que tamaño o alineamiento causen los patrones observados.
  • No demuestra que P² sea un controlador universal o superior en todos los rasgos, modelos y formulaciones.
  • No prueba estabilidad longitudinal, transferencia a conducta real, seguridad, utilidad clínica ni ausencia de daños o manipulación.
  • No permite inferir que las respuestas de las viñetas predigan decisiones del modelo fuera de esos cinco escenarios.

Modelos evaluados

  • BART-large-MNLI
  • GPT-Neo 2.7B
  • GPT-NeoX 20B
  • T0++ 11B
  • Alpaca 7B
  • GPT-3.5 / text-davinci-003 (labelled 175B by the paper)
  • GPT-4 (prompt paraphrasing only)

Instrumentos y métricas

  • Machine Personality Inventory, 120-item version
  • Machine Personality Inventory, approximately 1,000-item version
  • Big Five OCEAN mean scores and cross-item standard deviations
  • Five personality-relevant vignette scenarios
  • Binary comparative human evaluation on Prolific

Datos utilizados

  • International Personality Item Pool and IPIP-NEO derivatives
  • BFI-S items
  • 619,150 human IPIP-NEO-120 responses reported by Johnson (2014)
  • Five vignette contexts adapted from Kwantes et al. (2016)
  • Model-generated vignette essays

Evidencia y localización

  • Definición de MPI, fuentes de ítems y protocolo OCEAN: NeurIPS paper, pp. 4–5, section 3.1 and Table 1
  • Modelos, configuración y comparación con 619.150 respuestas humanas: NeurIPS paper, pp. 5–6, section 3.2 and Table 2
  • Construcción de P² y comparación con baselines: NeurIPS paper, pp. 7–8, sections 4.1–4.2 and Tables 3–4
  • Diseño y tasas de éxito de la evaluación humana: NeurIPS paper, pp. 9–10, section 4.3 and Tables 5–6
  • Alcance conceptual, riesgos y limitaciones reconocidas: NeurIPS paper, p. 10 and appendix p. 14, section 5 and Appendix A
  • Resultados MPI-1K, detalles de modelos y plantillas: NeurIPS paper, appendix pp. 15–17, Tables A1–A2 and sections B.1–B.4
  • Alpaca, sensibilidad a paráfrasis y textos completos de las viñetas: NeurIPS paper, appendix pp. 17–22, Tables A3–A6 and sections C.2–C.4