Extroversion or Introversion? Controlling The Personality of Your Large Language Models

Inducción y control de rasgos2024arXivRevisión editorial aprobada

Autores: Yanquan Chen, Zhen Wu, Junjie Guo, Shujian Huang, Xinyu Dai

Palabras clave: Computation and Language, Computers and Society

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
7
Hallazgos
15
Limitaciones
5
Evidencias

Resumen editorial

Español

Este preprint compara cinco formas de inducir respuestas asociadas a rasgos de personalidad: preentrenamiento continuo, ajuste supervisado (SFT), RLHF con PPO, prompts de sistema o usuario y PISF, que aplica un prompt de personalidad después de SFT. Prueba Llama-2-Chat-13B, Qwen-Chat-7B y ChatGLM2-6B; el análisis preliminar de prompts añade otros tamaños de Llama y Qwen. La evaluación consiste en 200 ítems ingleses de elección forzada, 50 por cada dicotomía MBTI, presentados con cinco variantes de prompt. Un clasificador Falcon-7B-Instruct convierte las respuestas libres en puntuaciones 1-5. El trabajo mide cuánto aumenta la proporción del rasgo objetivo, qué porcentaje de rasgos supera el 50%, cuánto cambian rasgos no objetivo y, para tipos de cuatro letras, si se inducen simultáneamente sus cuatro rasgos. En promedio, el paper ordena la eficacia inmediata como Prompt > SFT > RLHF > preentrenamiento continuo, aunque SFT suele lograr mayor tasa de éxito. Los prompts son más vulnerables a una instrucción inversa; combinar SFT y prompt produce algunas de las cifras más altas. Por ejemplo, PISF con prompt de usuario en Qwen reporta TIE 24,89, ISR 100, PIE 18,10 y PISR 100. Sin embargo, PISF no domina uniformemente la prueba inversa y las comparaciones no igualan datos, cómputo u objetivos de entrenamiento. Lo observado es control de respuestas a un cuestionario MBTI, no evidencia de una personalidad interna o estable. Los mismos conceptos y descripciones de rasgo aparecen en generación de datos, entrenamiento, prompt y evaluación; GPT-3.5 genera buena parte de los datos SFT/RLHF. No hay tareas conductuales, pruebas de capacidad o seguridad, intervalos, tests ni réplicas por semilla. La auditoría confirma que el dataset de evaluación público tiene 125 archivos y 25.000 filas, pero todos repiten la misma secuencia de 200 ítems. El clasificador se valida con un split aleatorio de 4.194 respuestas repetidas sobre esos mismos 200 índices, sin test independiente. El repositorio compila sintácticamente, pero 83 scripts contienen 554 rutas absolutas privadas; faltan checkpoints, generaciones crudas y el análisis completo. Por tanto, el estudio aporta evidencia útil de que prompts y ajuste pueden desplazar el estilo de respuesta bajo este instrumento, pero no permite reproducir de extremo a extremo sus tablas ni sostener afirmaciones psicológicas fuertes.

English

This preprint compares five ways to induce personality-associated responses: continual pretraining, supervised fine-tuning (SFT), PPO-based RLHF, system or user prompts, and PISF, which applies a personality prompt after SFT. It tests Llama-2-Chat-13B, Qwen-Chat-7B and ChatGLM2-6B; a preliminary prompt analysis adds other Llama and Qwen sizes. Evaluation uses 200 English forced-choice items, 50 per MBTI dichotomy, presented through five prompt variants. A Falcon-7B-Instruct classifier converts free-form outputs into 1-5 scores. The study measures the increase in target-trait proportion, the percentage of traits crossing 50%, changes in non-target traits and, for four-letter types, whether all four traits are induced together. On average, the paper orders immediate efficacy as Prompt > SFT > RLHF > continual pretraining, although SFT often achieves a higher success rate. Prompts are more vulnerable to an opposite-personality instruction, while combining SFT and prompting produces some of the strongest figures. For example, user-prompt PISF on Qwen reports TIE 24.89, ISR 100, PIE 18.10 and PISR 100. However, PISF does not dominate every reverse-prompt comparison, and methods are not matched for data, compute or objective. The experiment demonstrates control of MBTI-questionnaire responses, not an internal or stable personality. The same trait concepts and descriptions recur in data generation, training, prompts and evaluation, and GPT-3.5 generates much of the SFT/RLHF material. There are no behavioral tasks, capability or safety checks, confidence intervals, significance tests or seed replications. The artifact audit confirms that the public evaluation set has 125 files and 25,000 rows, but every file repeats the same ordered 200 items. The extractor is validated by a random split of 4,194 repeated responses over those same 200 indices, with no independent test set. Repository code compiles syntactically, but 83 scripts contain 554 private absolute paths; trained checkpoints, raw generations and the complete analysis are missing. The study therefore provides useful evidence that prompting and tuning can shift response style under this instrument, but its tables are not reproducible end to end and it does not support strong psychological claims.

Pregunta de investigación

¿Qué eficacia, efectos colaterales y resistencia a una instrucción de personalidad opuesta tienen el preentrenamiento continuo, SFT, RLHF, prompting y la combinación PISF para desplazar respuestas de LLM hacia rasgos o tipos MBTI objetivo?

Método

Comparación descriptiva de métodos sobre Llama-2-Chat-13B, Qwen-Chat-7B y ChatGLM2-6B. Cada condición responde 200 ítems MBTI-style en cinco variantes de prompt. Un extractor Falcon clasifica cada salida en una escala 1-5; después se calculan eficacia, tasa de éxito, cambio en rasgos no objetivo y éxito conjunto de los cuatro rasgos. La robustez se estima pidiendo la personalidad opuesta mediante Reverse Personality Prompt Induction.

Muestra: La evaluación base son 200 pares pregunta-opción, 50 por dicotomía E/I, S/N, T/F y J/P. Se repiten bajo cinco redacciones y 25 objetivos, sin personalidad, ocho rasgos y 16 tipos, formando 125 archivos y 25.000 filas correlacionadas. SFT usa 2.500 ejemplos por rasgo y 10.000 por tipo; PPO publica el mismo número de preguntas. El extractor usa 4.194 respuestas etiquetadas, con 15-21 repeticiones por índice del test.

Hallazgos

  • El paper resume la eficacia media como Prompt > SFT > RLHF > preentrenamiento continuo, pero SFT suele superar a prompting en tasa de éxito.
  • La inducción mediante prompt tiende a aumentar con el tamaño del modelo, con variación relevante por familia y rasgo.
  • SFT resiste mejor que prompt-only una instrucción inversa, aunque RPPI sigue induciendo rasgos opuestos en muchas condiciones.
  • PISF produce algunas de las mayores eficacias: Qwen con prompt de usuario obtiene TIE 24,89, ISR 100, PIE 18,10 y PISR 100.
  • En Llama, PISF con prompt de usuario obtiene TIE 24,76, ISR 100, PIE 16,19 y PISR 93,75.
  • La robustez de PISF no es uniforme: bajo RPPI, Qwen PISF reduce claramente la inducción inversa frente a SFT, mientras la comparación de Llama es mixta según métrica.
  • El artefacto confirma la forma de los datasets y el código principal, pero no publica los activos necesarios para reconstruir todas las tablas.

Limitaciones

  • MBTI ofrece objetivos discretos, pero el paper no valida sus dicotomías como medida psicométrica de modelos.
  • Las respuestas a un cuestionario de autorreporte simulado no demuestran personalidad interna, persistente o conductual.
  • Datos, prompts y evaluación comparten descripciones y vocabulario de rasgo, por lo que cumplimiento léxico y role-play son explicaciones plausibles.
  • GPT-3.5 genera gran parte de SFT y RLHF; el efecto puede incluir imitación de su estilo inducido.
  • Los cuatro métodos usan cantidades de datos, objetivos, parámetros actualizados y cómputo distintos; el ranking no es una comparación causal controlada.
  • Los autores reconocen que la capacidad y entrenamiento breve del actor/reward model pueden perjudicar RLHF.
  • No se publican intervalos, tests, varianza por semilla, corrección múltiple ni incertidumbre de las comparaciones.
  • Los 25.000 registros de evaluación repiten los mismos 200 ítems y no son observaciones independientes.
  • El extractor divide aleatoriamente respuestas repetidas de los mismos 200 ítems entre train y validación y no tiene test independiente.
  • Quince grupos con idéntica pregunta, opciones y predicción tienen etiquetas contradictorias en los datos del extractor.
  • No se evalúa capacidad general, veracidad, toxicidad, seguridad ni degradación en tareas ajenas a personalidad.
  • RPPI puede medir robustez del objetivo, pero también rigidez o menor seguimiento de instrucciones; falta un control genérico de conflicto.
  • Faltan checkpoints, adaptador Falcon, generaciones crudas, resultados completos y un pipeline de figuras reproducible.
  • Ochenta y tres scripts dependen de rutas privadas y existen defectos de runtime, además de no haber tests, CI, tags o release.
  • El estudio es un preprint arXiv v1 y solo cubre inglés y modelos de 2023.

Qué no demuestra

  • No demuestra que los LLM posean personalidad humana o un tipo MBTI latente estable.
  • No demuestra que el cambio de respuestas generalice fuera del cuestionario.
  • No establece que PISF sea universalmente el método más eficaz y robusto.
  • No prueba que el ranking de métodos sea causal bajo recursos equivalentes.
  • No prueba que RLHF sea inherentemente peor para controlar personalidad.
  • No valida el 95,95% del extractor sobre ítems, modelos o estilos realmente no vistos.
  • No separa personalidad de imitación léxica, role-play o seguimiento de instrucciones.
  • No prueba que resistir RPPI sea distinto de ignorar instrucciones conflictivas.
  • No demuestra que el control preserve capacidad, seguridad, veracidad o utilidad.
  • No generaliza a otras lenguas, instrumentos, generaciones de modelos o contextos conductuales.
  • No permite reproducir de extremo a extremo las tablas con el repositorio público actual.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2406.04583v1, submitted 2024-06-07; official GitHub code and public Google Drive datasets audited separately

Fuente consultada: https://arxiv.org/abs/2406.04583

Revisión: Codex 21-page visual, arXiv-v1, official-code, public-evaluation-and-training-artifact, item-grain, answer-extractor, runtime, MBTI-construct, statistics, reproducibility and claim-boundary audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • Llama-2-Chat-13B
  • Qwen-Chat-7B
  • ChatGLM2-6B
  • Falcon-7B-Instruct answer extractor
  • GPT-3.5-turbo-1106 data generator
  • Llama-2-Chat 7B and 70B in prompt-size analysis
  • Qwen-Chat 1.8B, 14B and 72B in prompt-size analysis

Instrumentos y métricas

  • Two-hundred-item English MBTI-style forced-choice questionnaire
  • Five generated prompt phrasings per item bank
  • Trait Induction Efficacy, TIE
  • Induction Success Rate, ISR
  • Trait Induction Side Effect, TSE
  • Personality Induction Efficacy, PIE
  • Personality Induction Success Rate, PISR
  • Reverse Personality Prompt Induction, RPPI
  • Falcon-7B-Instruct five-class answer extractor

Datos utilizados

  • Public evaluate_datasets.zip: 125 JSON files, 25,000 rows and one repeated 200-item bank
  • Public SFT payload: 180,000 rows across 24 files, 20,000 exact records unique
  • Public PPO prompt payload: 180,000 rows across 24 files, 10,000 exact questions unique
  • Public answer-extractor v1.json: 4,194 labeled responses over 200 item indices
  • Public reward-augmentation archive listed at 269,197,495 bytes
  • Public continual-pretraining archive listed at 415,694,799 bytes

Evidencia y localización

  • Metadatos, versión, materias y abstract exacto: arXiv:2406.04583v1
  • Método, fórmulas, configuración, tablas, discusión, limitaciones y apéndices: arXiv PDF, 21 páginas, sha256 6d59fe71f09269e76a6ac6deb6cba36bd5c69ff6bcc0b9a5aaf996003fd168c2
  • Código, scripts, rutas, dependencias, defectos y activos ausentes: github.com/yqchen0205/PISF commit 9729b91fa61b0096269774023d57bd8009d40f80
  • Forma, repetición, unicidad y calidad de datasets: Public Google Drive evaluate_datasets.zip and train_datasets.zip; evaluated payload sha256 a9e732e68447c12feda2d16d79f07b53116a6427865a22291aa4e37f5d2401ce
  • Auditoría de constructo, resultados, código, datos, reproducibilidad y límites de afirmación: reports/verification/article-244-arxiv-pisf-personality-control-mbti-code-data-and-claim-audit.json