Manipulating the Perceived Personality Traits of Language Models

Inducción y control de rasgos2023ACL AnthologyRevisión editorial aprobada

Autores: Graham Caron, Shashank Srivastava

Palabras clave: Personality traits, Big Five personality model, Language models, Dialog systems, Computational psychology

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

2
Autores
9
Hallazgos
15
Limitaciones
11
Evidencias

Resumen editorial

Español

Este trabajo de Findings of EMNLP 2023 estudia la personalidad percibida de BERT-base y GPT-2 de 124M mediante una adaptación del cuestionario IPIP Big Five de 50 ítems. Convierte las respuestas de acuerdo/desacuerdo en los adverbios never, rarely, sometimes, often y always y transforma cada ítem en una frase para completar. BERT selecciona el token enmascarado más probable y GPT-2 la oración completa más probable. Las puntuaciones deterministas se mapean a percentiles de una base externa de 1.015.000 cuestionarios humanos. Que los diez resultados base estén a menos de 26 puntos del percentil mediano no demuestra que el preentrenamiento reproduzca una población: el paper no publica los márgenes del TOST ni justifica tratar una salida de modelo como observación comparable a una persona. El experimento central antepone a cada ítem uno de diez enunciados del mismo rasgo combinado con cinco intensidades. Esto produce 500 respuestas y 50 puntuaciones por rasgo y modelo. La dirección esperada r_cm se deriva de la misma clave de puntuación y de la intensidad lexical, y se correlaciona con el cambio observado. Las correlaciones globales son 0,40 para BERT y 0,54 para GPT-2; la mediana de las cincuenta correlaciones por ítem, cada una calculada con solo cinco puntos, es 0,84 y 0,81. Sin embargo, cada enunciado se usa también como contexto de sí mismo, lo que permite copiar el modificador. Al reemplazar esa respuesta por el baseline, las medias bajan a 0,25 y 0,40. Los dobles negativos producen acumulaciones cerca de −1 y una prueba alternativa excluye neutral y solo reporta seis de diez combinaciones rasgo-modelo. Por tanto, el resultado sólido es sensibilidad predecible a cuantificadores y contenido lexical, no control validado de personalidad. Un análisis exploratorio usa 1.119 descripciones de Reddit como contexto. Regresiones bag-of-words y n-gram se ajustan solo a casos con cambio absoluto ≥1 y se interpretan mediante pesos extremos; no se reportan particiones de validación ni capacidad predictiva y aparecen asociaciones ruidosas o espurias. Un estudio IRB con Mechanical Turk conserva 404 personas: 199 reciben definiciones de los Big Five antes de escribir y 205 no; alrededor de una cuarta parte incumple el mínimo de 75 palabras. Tras filtrar outliers o longitud, la correlación entre puntuaciones humanas y las obtenidas al usar su autodescripción como contexto llega a 0,44 para BERT y 0,48 para GPT-2 en respuestas dirigidas; en no dirigidas es 0,40 y 0,48 sin outliers. No se ofrecen intervalos, p-valores, muestra residual por filtro, validación externa ni comparación con clasificadores de texto. Esto aporta evidencia moderada de que una descripción explícita contiene señales asociadas al autoinforme de su autor, no de que el modelo adopte esa personalidad o pueda sustituir la evaluación humana. Finalmente, GPT-2 genera 50 tokens desde 1.500 combinaciones aproximadas de un enunciado de rasgo y seis prompts neutros. El texto generado se vuelve a introducir en el mismo GPT-2 como contexto del cuestionario y su puntuación correlaciona 0,49 con la del enunciado inicial. El diseño es circular y carece de jueces humanos: puede reflejar continuación lexical, no personalidad percibida por usuarios. El paper aporta un antecedente útil de priming contextual y dos conjuntos de descripciones, pero no establece rasgos internos, persistencia, transferencia conductual, robustez en modelos modernos ni seguridad clínica. La auditoría del repositorio enlazado en el PDF, en el commit 3388f194a6410162e4c2a614e12846f02cf5a939, confirma los dos CSV con exactamente 199 y 205 filas válidas, pero no encuentra código pese a que el README anuncia «dataset and code». El supuesto `reddit-data.json` contiene 1.119 cadenas, pero no puede parsearse como JSON porque está delimitado por llaves en vez de corchetes. Tampoco hay licencia, resultados derivados, parámetros de ejecución ni scripts para regenerar tablas y figuras. Los datos humanos son parcialmente comprobables; los experimentos completos no son reproducibles desde el artefacto publicado.

English

This Findings of EMNLP 2023 paper studies the perceived personality of BERT-base and 124M-parameter GPT-2 through an adaptation of the 50-item IPIP Big Five questionnaire. It replaces agreement choices with the adverbs never, rarely, sometimes, often, and always and turns each item into sentence completion. BERT selects the most likely masked token, while GPT-2 selects the most likely completed sentence. Deterministic scores are mapped to percentiles from an external dataset of 1,015,000 human questionnaires. The fact that all ten base-model results fall within 26 percentile points of the human median does not show that pretraining reproduces a population: the paper does not report TOST equivalence bounds or justify treating one model output as a human-comparable observation. The central experiment prefixes each target item with one of ten same-trait statements combined with five intensity modifiers, yielding 500 responses and 50 scores per trait and model. Expected direction r_cm is constructed from the same scoring key and lexical intensity, then correlated with observed change. Aggregate correlations are .40 for BERT and .54 for GPT-2; the median of fifty per-item correlations, each computed from only five points, is .84 and .81. However, every statement is also used as context for itself, allowing the model to copy the modifier. Replacing that response with baseline lowers mean correlations to .25 and .40. Double negations create clusters near −1, and an alternative framing excludes neutral and reports only six of ten trait-model combinations. The defensible result is thus predictable sensitivity to quantifiers and lexical content, not validated personality control. An exploratory analysis uses 1,119 Reddit personality descriptions as context. Bag-of-words and n-gram regressions are fitted only to cases with absolute change ≥1 and interpreted through extreme weights; no validation split or predictive performance is reported, and several associations are noisy or spurious. An IRB-approved Mechanical Turk study retains 404 people: 199 see Big Five definitions before writing and 205 do not; roughly one quarter miss the 75-word minimum. After outlier or length filtering, correlations between human scores and scores obtained by conditioning on their self-description reach .44 for BERT and .48 for GPT-2 in directed responses; for undirected responses they are .40 and .48 after outlier removal. The paper gives no intervals, p-values, remaining sample sizes per filter, external validation, or text-classifier comparison. This moderately supports that explicit self-descriptions contain signals associated with their authors' self-reports, not that a model adopts their personality or can replace human assessment. Finally, GPT-2 generates 50 tokens from approximately 1,500 combinations of trait statements and six neutral prompts. The generated text is then fed back into the same GPT-2 as questionnaire context, and its score correlates .49 with the initial statement score. This is a circular design without human judges and can reflect lexical continuation rather than personality perceived by users. The paper is a useful early study of contextual priming and contributes two description datasets, but it does not establish internal traits, persistence, behavioral transfer, robustness in modern models, or clinical safety. An audit of the PDF-linked repository at commit 3388f194a6410162e4c2a614e12846f02cf5a939 confirms two valid CSV files with exactly 199 and 205 rows, but finds no code even though the README advertises “dataset and code.” The purported `reddit-data.json` contains 1,119 strings but cannot be parsed as JSON because it is enclosed in braces rather than brackets. The repository also has no license, derived outputs, execution parameters, or scripts for regenerating tables and figures. The human data are partially inspectable, but the complete experiments are not reproducible from the published artifact.

Pregunta de investigación

¿Pueden las puntuaciones Big Five obtenidas de BERT y GPT-2 modificarse de forma predecible con distintos contextos, reflejar señales de personalidad en autodescripciones humanas y trasladarse al texto generado?

Método

Se adapta el IPIP Big Five de 50 ítems a completado de frases y se puntúan las opciones más probables de BERT-base y GPT-2. Se anteponen enunciados del cuestionario con cinco cuantificadores, se correlaciona la dirección esperada con el cambio de puntuación y se repite con descripciones de Reddit y de 404 participantes MTurk. Para GPT-2 se generan textos de 50 tokens desde contextos de rasgo y esos textos se reutilizan como contexto del mismo cuestionario. Se emplean Pearson, TOST, regresiones bag-of-words/n-gram y mapeo a percentiles humanos.

Muestra: Dos modelos abiertos sin fine-tuning. La manipulación de ítems produce 500 respuestas y 50 puntuaciones por rasgo y modelo. Reddit aporta 1.119 contextos. La encuesta conserva 404 participantes: 199 respuestas dirigidas y 205 no dirigidas. El experimento generativo combina 250 pares ítem-modificador con seis prompts, aproximadamente 1.500 continuaciones de 50 tokens. No hay evaluación humana de los textos generados.

Hallazgos

  • Las diez puntuaciones base se sitúan dentro de 26 percentiles de la mediana de las normas humanas, pero son salidas deterministas individuales y no muestras poblacionales.
  • La correlación agregada entre intensidad esperada y cambio es 0,40 en BERT y 0,54 en GPT-2; las medianas por ítem de cinco puntos son 0,84 y 0,81.
  • Al neutralizar el ítem que se evalúa a sí mismo, las correlaciones medias descienden a 0,25 para BERT y 0,40 para GPT-2.
  • Dobles negativos generan correlaciones cercanas a −1 y la robustez con una formulación alternativa solo se muestra para una parte de los rasgos.
  • En la encuesta, las correlaciones sin outliers alcanzan 0,44/0,48 para BERT/GPT-2 en respuestas dirigidas y 0,40/0,48 en no dirigidas.
  • Los contextos cubren extremos cercanos a 0–100 percentil para responsabilidad y estabilidad emocional en BERT, pero esos extremos no representan una distribución ni una intervención estable.
  • La puntuación del texto generado por GPT-2 correlaciona 0,49 con la del contexto inicial al ser evaluada de nuevo por el mismo modelo.
  • El repositorio publicado contiene exactamente 199 respuestas dirigidas y 205 no dirigidas en CSV, coherentes con las 404 retenidas que declara el artículo.
  • El repositorio no contiene código; `reddit-data.json` conserva 1.119 textos pero es sintácticamente inválido y el proyecto no incluye licencia ni outputs derivados.

Limitaciones

  • Sustituir acuerdo por adverbios de frecuencia cambia el significado del instrumento; longitud de token y frecuencia de preentrenamiento sesgan las opciones.
  • La dirección esperada se construye con la misma clave de puntuación y cuantificadores usados como entrada, por lo que parte de la correlación es mecánica y lexical.
  • Cada correlación por ítem usa solo cinco intensidades y puede quedar dominada por monotonicidad o dobles negativos; la mediana 0,84/0,81 no es una estimación estable de efecto general.
  • El ítem de contexto también se pregunta durante la evaluación, creando fuga directa; la corrección parcial reduce las correlaciones.
  • No se publican márgenes del TOST ni se justifica comparar una puntuación de modelo con una distribución de personas como evidencia de equivalencia.
  • El análisis Reddit selecciona casos por la magnitud del propio outcome y no reporta train/test, regularización, error predictivo o estabilidad de los pesos.
  • La encuesta filtra por outliers y longitud sin informar n final, intervalos o p-valores; las autodescripciones y el cuestionario comparten contenido semántico explícito.
  • No hay baseline de clasificador de personalidad, validación en una muestra externa ni evaluación de criterio, comportamiento o resultados reales.
  • GPT-2 genera y vuelve a puntuar sus propios textos con el mismo mecanismo, sin anotadores humanos de personalidad percibida ni control por copia lexical.
  • Solo se estudian dos modelos ingleses pequeños y antiguos; no se indican parámetros de decodificación, semillas o replicaciones para generación.
  • El README promete datos y código, pero el commit público inspeccionado solo contiene README y tres archivos de datos; no hay implementación, configuración, semillas, outputs ni scripts de reproducción.
  • El archivo Reddit publicado no es JSON válido, no incluye un esquema o mapeo de procedencia por respuesta y el repositorio carece de licencia explícita.
  • No se informa temperatura, estrategia de muestreo, top-k/top-p, semillas ni número de réplicas para las 1.500 continuaciones de GPT-2.
  • El apéndice afirma incorrectamente que GPT-2 fue preentrenado en BooksCorpus; el informe técnico citado describe WebText como su corpus de entrenamiento.
  • La Figura 6 etiqueta como X_subject una magnitud que el texto y el eje definen como X_cm, una inconsistencia editorial que dificulta interpretar el control comparado.

Qué no demuestra

  • No demuestra que BERT o GPT-2 posean personalidad, autoconcepto o rasgos psicológicos internos.
  • No valida la versión modificada del IPIP ni su equivalencia con el cuestionario humano original.
  • No demuestra control de persona persistente, causal o transferible fuera del contexto inmediato.
  • No prueba que los percentiles de una salida de modelo sean comparables con percentiles de individuos humanos.
  • No demuestra predicción clínica o psicométrica suficiente para evaluar personas cuando no puedan participar.
  • No prueba que usuarios humanos perciban en el texto generado los mismos rasgos que asigna la autoevaluación circular.
  • No establece vulnerabilidad a ataques dirigidos ni seguridad de intervenciones en diálogo, educación o salud mental.

Trazabilidad

Alcance: Texto completo

Versión: Findings of EMNLP 2023, ACL Anthology 2023.findings-emnlp.156

Fuente consultada: https://aclanthology.org/2023.findings-emnlp.156.pdf

Revisión: Codex full-text, bilingual-fidelity, visual, metadata, duplicate-version, psychometric-construct, statistical-unit, generation-circularity, dataset, repository-artifact, reproducibility, ethics and evidence-level audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • BERT-base masked language model
  • GPT-2 124M

Instrumentos y métricas

  • 50-item IPIP Big Five Factor Markers
  • Modified five-adverb sentence-completion response scale
  • TOST equivalence test
  • Pearson correlations
  • Bag-of-words, bigram and trigram regressions
  • Human-percentile mapping from OpenPsychometrics norms

Datos utilizados

  • OpenPsychometrics responses from 1,015,000 individuals
  • 1,119 Reddit personality-description responses
  • 404 Mechanical Turk Big Five assessments and self-descriptions
  • Item-context manipulation grid
  • GPT-2-generated 50-token continuations
  • Published repository: 199 directed and 205 undirected MTurk survey rows in two valid CSV files
  • Published Reddit artifact: 1,119 text strings in a malformed JSON file

Evidencia y localización

  • Alcance de personalidad percibida, correlaciones anunciadas y contribuciones: Findings of EMNLP 2023, pp. 2370–2372, Abstract and sections 1–3
  • Adaptación del IPIP, modelos y percentiles humanos: Findings of EMNLP 2023, pp. 2372–2373, sections 4–5 and Table 1
  • Diseño de manipulación, correlaciones y fuga por autoítem: Findings of EMNLP 2023, pp. 2373–2375, section 6.1, Figures 2–3 and Tables 2–3
  • Corpus Reddit y regresiones exploratorias: Findings of EMNLP 2023, pp. 2374–2375, section 6.2 and Appendix D
  • Muestra MTurk, filtros y correlaciones con autoinforme: Findings of EMNLP 2023, pp. 2375–2377, section 6.3, Figure 4 and Table 6
  • Rangos observados y extremos percentiles: Findings of EMNLP 2023, pp. 2376–2377, section 6.4 and Figure 5
  • Generación GPT-2 y evaluación circular con correlación 0,49: Findings of EMNLP 2023, pp. 2377–2378, section 7, Figure 6 and Table 7
  • Límites declarados, generalización y riesgos propuestos: Findings of EMNLP 2023, pp. 2378–2379, Conclusion, Limitations and Ethics
  • Ítems, normas, scoring y detalles de datos: Findings of EMNLP 2023, pp. 2381–2386, Appendices A–F
  • Disponibilidad real, filas, validez sintáctica y ausencia de código/licencia: GitHub repository commit 3388f194a6410162e4c2a614e12846f02cf5a939; README, directed-survey-data.csv, undirected-survey-data.csv and reddit-data.json; checked 15 Jul 2026
  • Inspección visual integral y errores del apéndice/figura: All 17 Findings of EMNLP 2023 PDF pages rendered and visually inspected, including Figures 1–7 and Appendices A–F; checked 15 Jul 2026