Estimating the Personality of White-Box Language Models

Evaluación y validez psicométrica2022arXivRevisión editorial aprobada

Autores: Saketh Reddy Karra, Son The Nguyen, Theja Tulabandhula

Palabras clave: white-box language models, Big Five personality, zero-shot classification, personality estimation, open-ended text generation, model anthropomorphism, personality modification

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
13
Hallazgos
33
Limitaciones
17
Evidencias

Resumen editorial

Español

Este preprint v2 propone puntuar como Cinco Grandes el texto de cuatro corpus y las continuaciones de seis modelos: GPT-2, GPT-3, GPT-3.5-Turbo, LLaMA 7B cuantizado a 4 bits, Transformer-XL y XLNet. No pregunta a los modelos por una opción Likert. Usa las 50 frases del cuestionario como prompts, genera 30 continuaciones independientes por frase y modelo y pasa cada texto a un clasificador zero-shot basado en inferencia natural. Para cada rasgo, la llamada “Approach 3” compara dos etiquetas opuestas, por ejemplo, extraversion/introversion, y transforma la probabilidad de entailment a una escala 1–5. El paper no identifica el checkpoint NLI, no valida sus puntuaciones contra juicios humanos o un instrumento psicométrico y no prueba empíricamente que Approach 3 supere a las otras dos. Por tanto, los números describen las asociaciones léxicas de un clasificador auxiliar con textos condicionados por el cuestionario, no rasgos psicológicos internos. Los corpus se analizan por frases o párrafos cortos con submuestras: 10% de BookCorpus, 2% de una Wikipedia inglesa de mayo de 2020, 20% del WebText Test Set y 100% de WikiText-103. Estas sustituciones no son necesariamente los datos exactos de entrenamiento. En los modelos, la tabla principal informa medianas (con una dispersión no definida): GPT-3.5-Turbo es mayor en amabilidad, 4,41, y extraversión, 4,06; LLaMA en responsabilidad, 4,01, y estabilidad emocional, 3,76; Transformer-XL en apertura, 4,02. GPT-2 queda cerca de 3 en los cinco rasgos. Las comparaciones están confundidas por tamaño, entrenamiento, alineamiento, versión de API y decodificación. Además, la puntuación de GPT-2 cambia mucho según se clasifique toda la respuesta, solo la primera frase o la mediana de sus frases; las distancias Wasserstein llegan a 0,610 en apertura. Al comparar WebText Test con GPT-2, las distancias son pequeñas sin prompt, 0,025 a 0,102, y mucho mayores al incluir las frases Big Five, hasta 0,630 en extraversión. Esto demuestra principalmente que el prompt altera el contenido que ve el clasificador; no valida que el cuestionario revele una personalidad inherente ni que GPT-2 “herede” psicológicamente la personalidad del corpus. El trabajo también afina GPT-2 con respuestas SIOP etiquetadas. Method 1 conserva textos con score >4 y entrena 20 épocas; cambia muchas puntuaciones a la vez y no siempre eleva el rasgo objetivo. Method 2 convierte cada rasgo en clasificación binaria con cinco umbrales y entrena 10 épocas. Para extraversión, el baseline 3,07 pasa a 2,89, 3,19, 3,24, 2,90 y 3,25: baja en dos de cinco configuraciones, aunque el texto lo presenta como mejora. No hay seeds, réplicas de fine-tuning, tests estadísticos, intervalos de confianza, evaluación de calidad lingüística, conducta, persistencia ni jueces humanos. La recomendación de usar LLaMA en salud mental por su mediana de “estabilidad emocional” no está respaldada por ninguna evaluación clínica, de empatía o seguridad. La evidencia útil es más modesta: distintos modelos, prompts, segmentos de texto y fine-tunings producen distribuciones distintas bajo un clasificador NLI concreto pero no especificado.

English

This v2 preprint proposes assigning Big Five scores to text from four corpora and continuations from six models: GPT-2, GPT-3, GPT-3.5-Turbo, a 4-bit-quantized LLaMA 7B, Transformer-XL, and XLNet. It does not ask models to select Likert options. Instead, it uses the 50 questionnaire statements as prompts, generates 30 independent continuations per statement and model, and passes every text to a natural-language-inference zero-shot classifier. For each trait, the preferred “Approach 3” compares two opposite labels, such as extraversion/introversion, and maps entailment probability onto a 1–5 scale. The paper does not identify the NLI checkpoint, validate its scores against human judgments or a psychometric instrument, or empirically show that Approach 3 outperforms the other two approaches. The scores therefore describe an auxiliary classifier’s lexical associations with questionnaire-conditioned text, not internal psychological traits. Corpora are processed as sentences or short paragraphs using subsamples: 10% of BookCorpus, 2% of an English Wikipedia snapshot from May 2020, 20% of the WebText Test Set, and all of WikiText-103. These substitutes are not necessarily the exact training data. In the model comparison, the main table reports medians with an undefined dispersion: GPT-3.5-Turbo is highest on agreeableness, 4.41, and extraversion, 4.06; LLaMA on conscientiousness, 4.01, and emotional stability, 3.76; Transformer-XL on openness, 4.02. GPT-2 remains close to 3 on all five traits. Comparisons are confounded by scale, training data, alignment, API version, and decoding. GPT-2 scores also change substantially depending on whether the classifier sees the whole response, first sentence, or median across sentences; Wasserstein distances reach .610 for openness. Comparing the WebText Test Set with GPT-2 produces small distances without prompts.025 to .102, and much larger distances when Big Five statements are included, up to .630 for extraversion. This mainly shows prompt-induced changes in what the classifier receives; it does not validate the questionnaire as a measure of inherent personality or show that GPT-2 psychologically “inherits” a corpus personality. The paper also fine-tunes GPT-2 on labeled SIOP responses. Method 1 keeps texts with scores above 4 and trains for 20 epochs; many traits move together and the target trait does not always increase. Method 2 turns each trait into binary classification at five thresholds and trains for 10 epochs. For extraversion, a 3.07 baseline becomes 2.89, 3.19, 3.24, 2.90, and 3.25: it decreases in two of five settings even though the prose calls the result an improvement. There are no seeds, fine-tuning replications, statistical tests, confidence intervals, language-quality evaluation, behavioral tests, persistence tests, or human judges. The recommendation to use LLaMA in mental-health care because of its “emotional stability” median is unsupported by any clinical, empathy, or safety evaluation. The defensible evidence is narrower: different models, prompts, text segments, and fine-tuning runs yield different distributions under one unspecified NLI classifier.

Pregunta de investigación

¿Puede un clasificador zero-shot basado en NLI convertir texto de corpus y continuaciones provocadas por un cuestionario Big Five en perfiles comparables entre modelos, y pueden esos perfiles modificarse al afinar GPT-2 con datos etiquetados?

Método

Se fragmentan cuatro corpus en frases o párrafos y se puntúan con tres formulaciones zero-shot; el análisis principal usa pares de etiquetas opuestas y transforma entailment a una escala 1–5. Se generan 30 respuestas independientes para cada uno de 50 prompts y seis modelos. Se comparan distribuciones, medianas y distancias Wasserstein, incluido GPT-2 frente a WebText. Después se afina GPT-2 con respuestas SIOP: una vez como language modeling sobre ejemplos con score >4 y otra como clasificación binaria con umbrales 2,5–4,5. No hay evaluación humana ni validación psicométrica del clasificador auxiliar.

Muestra: Cuatro corpus textuales, seis modelos y 50 prompts. El protocolo declara 30 generaciones por prompt y modelo, lo que implicaría 1.500 respuestas por modelo y 9.000 en total, aunque no publica el corpus resultante. Para modificar rasgos se usa solo GPT-2 y un subconjunto SIOP cuyo tamaño por rasgo o umbral no se informa.

Hallazgos

  • La tabla principal asigna a GPT-2 medianas 3,41, 3,18, 3,07, 3,15 y 2,97 para amabilidad, responsabilidad, extraversión, estabilidad emocional y apertura.
  • GPT-3.5-Turbo obtiene la mayor amabilidad, 4,41, y extraversión, 4,06; LLaMA la mayor responsabilidad, 4,01, y estabilidad emocional, 3,76; Transformer-XL la mayor apertura, 4,02.
  • Las cantidades entre paréntesis se denominan incertidumbres, pero el paper no define si son desviaciones estándar, errores, intervalos u otra medida.
  • En GPT-2, cambiar de respuesta completa a primera frase o mediana por frases produce distancias Wasserstein de 0,248–0,591 y 0,248–0,610, respectivamente.
  • La sensibilidad a segmentación demuestra que el score depende sustancialmente de la unidad textual elegida.
  • WebText Test frente a GPT-2 sin prompt tiene distancias 0,102, 0,077, 0,048, 0,032 y 0,025; con prompts Big Five suben a 0,205, 0,427, 0,630, 0,154 y 0,139.
  • El cambio con y sin prompt muestra contaminación o inducción por el cuestionario; no distingue un rasgo del contenido textual que el propio prompt introduce.
  • Method 1 mueve varias dimensiones a la vez; afinar con datos de amabilidad reduce la amabilidad 3,41→3,33, mientras afinar con apertura eleva también extraversión 3,07→3,63.
  • En Method 2 para extraversión, solo tres de cinco umbrales superan el baseline; 2,5 y 4,0 lo reducen a 2,89 y 2,90.
  • Las tablas del apéndice muestran desplazamientos cruzados y no monotónicos en los cinco rasgos y umbrales.
  • La recomendación de LLaMA para salud mental es una extrapolación del autor y no un resultado evaluado.
  • No se presentan comparaciones cuantitativas que validen Approach 3 frente a Approach 1 o 2, pese a describirla como más precisa.
  • No se publican textos completos, outputs del clasificador, código, semillas o resultados por corrida que permitan recalcular las distribuciones.

Limitaciones

  • El checkpoint, arquitectura, versión y configuración del modelo NLI zero-shot no se identifican; todo resultado depende de ese componente.
  • El clasificador auxiliar no se valida en textos generados por LLM con etiquetas humanas Big Five ni contra respuestas Likert reales.
  • La transformación de probabilidades de entailment a 1–5 no especifica extremos, calibración o justificación psicométrica.
  • Los pares de etiquetas son ad hoc e incluyen “antoganism” mal escrito y “closeness” como opuesto de openness, lo que puede cambiar el resultado del NLI.
  • Approach 3 se declara más precisa sin benchmark, ground truth o comparación de error con Approach 1 y 2.
  • El cuestionario humano se convierte en prompts de continuación abierta, cambiando el constructo y la función de respuesta.
  • El prompt contiene las palabras que después clasifica el NLI; no se demuestra que se retire completamente del texto evaluado ni se controla su fuga lexical.
  • Las 30 generaciones no son réplicas estadísticas independientes de una población de modelos y no se reportan seeds.
  • No se identifican motores, snapshots, fechas ni parámetros completos de GPT-3 y GPT-3.5-Turbo.
  • El checkpoint comunitario o exacto de LLaMA 7B 4-bit no se especifica.
  • El texto afirma centrarse en foundation models, pero incluye GPT-3.5-Turbo, descrito por el propio paper como ajustado con feedback humano.
  • Se agrupan como black box GPT-3, GPT-3.5-Turbo y LLaMA por arquitectura “no divulgada”, aunque LLaMA se describe y distribuye como modelo de pesos accesibles; la taxonomía es incoherente.
  • Los hiperparámetros max length 256, temperatura 1 y top-p 1 se asocian al pipeline Hugging Face; no queda claro que las APIs propietarias usen condiciones equivalentes.
  • Comparar modelos confunde arquitectura, tamaño, corpus, instruct tuning, alineamiento, proveedor, versión y decodificación.
  • La Wikipedia de mayo de 2020 no es necesariamente la mezcla exacta usada para GPT-3 o XLNet y el paper reconoce que esa versión no es pública.
  • WebText Test Set no es el corpus de entrenamiento de GPT-2 y su representatividad no se demuestra.
  • Las submuestras de corpus no tienen procedimiento aleatorio, seeds, número de frases finales o estimación de error de muestreo.
  • Fragmentar documentos en frases cambia el objeto de análisis; una frase no posee la personalidad de un corpus, autor o modelo.
  • Las distribuciones de texto factual y de ficción se interpretan antropomórficamente sin validación externa.
  • Las “incertidumbres” de las tablas no se definen y no hay intervalos de confianza ni tests entre modelos.
  • El término “significativo” se usa para cambios sin pruebas inferenciales, tamaño de efecto o corrección por comparaciones múltiples.
  • La distancia Wasserstein se presenta como perteneciente a [0,1] sin explicar la normalización de scores 1–5.
  • La ecuación A.1 del apéndice es una formulación incompleta o incorrecta de Wasserstein y no documenta la implementación real.
  • La línea base de estabilidad emocional cambia de 3,15 (0,46) en Table 5 a 3,15 (0,50) en Tables 8–9.
  • Method 1 no informa tamaño de cada subconjunto SIOP, tokenizer, optimizer, longitud, stopping, checkpoint selection o replicaciones.
  • Method 2 no informa balance de clases por umbral, splits, accuracy del clasificador auxiliar ni si se restaura el head generativo de forma válida.
  • No hay baseline que afine GPT-2 con igual volumen de texto aleatorio o no relacionado con personalidad.
  • No se mide calidad de generación, perplexity, diversidad, toxicidad, factualidad o degradación tras fine-tuning.
  • No se prueba persistencia entre prompts, tareas o turnos, ni generalización fuera del cuestionario.
  • No hay evaluadores humanos de personalidad percibida, empatía, utilidad o seguridad.
  • El paper no contiene sección de limitaciones, ética, disponibilidad de datos o código, ni enlaza una implementación reproducible.
  • La recomendación para salud mental no evalúa pacientes, profesionales, crisis, daño, sesgos, privacidad, supervisión o resultados clínicos.
  • SSRN y arXiv presentan el trabajo como preprint; no se identificó una publicación revisada por pares en los registros consultados.

Qué no demuestra

  • No demuestra que ninguno de los modelos posea personalidad, identidad, emociones o rasgos internos.
  • No valida el uso del IPIP como prompt abierto ni la escala NLI 1–5 como instrumento psicométrico.
  • No demuestra que el clasificador zero-shot mida los Cinco Grandes en lugar de palabras asociadas a sus etiquetas.
  • No prueba que las diferencias entre modelos sean estables, causales o atribuibles a su corpus de entrenamiento.
  • No demuestra que un corpus, frase factual o dataset tenga personalidad psicológica.
  • No prueba que WebText Test represente WebText train ni que una Wikipedia de 2020 represente los datos exactos de GPT-3.
  • No demuestra que GPT-2 herede personalidad; muestra similitud de distribuciones textuales bajo el mismo clasificador.
  • No demuestra control preciso de rasgos: los rasgos no objetivo cambian y varios objetivos bajan.
  • No establece que Method 2 mejore siempre extraversión ni los otros rasgos.
  • No demuestra que el fine-tuning conserve calidad, seguridad o capacidades del modelo.
  • No valida las comparaciones con personas o percentiles humanos.
  • No demuestra que usuarios perciban los rasgos asignados por el NLI.
  • No demuestra persistencia en conversaciones, tareas distintas o versiones modernas de los modelos.
  • No justifica seleccionar un modelo para atención al cliente, formación o salud mental.
  • No demuestra empatía, estabilidad emocional clínica, eficacia terapéutica ni ausencia de daño.
  • No permite reproducir completamente los resultados con los materiales enlazados.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2204.12000v2 [cs.CL], 10 May 2023

Fuente consultada: https://arxiv.org/pdf/2204.12000

Revisión: Codex full-text, bilingual-fidelity, visual, metadata, psychometric-construct, NLI-classifier, prompt-contamination, statistical-unit, model-version, dataset-provenance, fine-tuning, reproducibility, clinical-claim, ethics and evidence-level audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-2
  • GPT-3, exact API engine/version not reported
  • GPT-3.5-Turbo, exact API snapshot/date not reported
  • LLaMA 7B 4-bit quantized, exact checkpoint not reported
  • Transformer-XL
  • XLNet
  • Unspecified NLI model used as the zero-shot classifier

Instrumentos y métricas

  • 50-item IPIP Big Five questionnaire used as open-ended prompts
  • Three NLI zero-shot scoring approaches
  • Paired trait labels and entailment-to-1–5 interpolation
  • Median and undefined parenthetical uncertainty statistic
  • One-dimensional Wasserstein distance
  • Three response segmentation modes
  • GPT-2 causal-language-model fine-tuning
  • GPT-2 auxiliary binary-classification fine-tuning

Datos utilizados

  • BookCorpus, 5.75 GB with 10% sampled
  • English Wikipedia snapshot dated 1 May 2020, 34.88 GB with 2% sampled
  • WebText Test Set, 1.28 GB with 20% sampled
  • WikiText-103, 0.70 GB with 100% used
  • SIOP 2019 open-ended situational-judgment responses with Big Five labels
  • Generated continuations: nominally 50 prompts × 30 runs × 6 models

Evidencia y localización

  • Identidad, versión y abstract completo: arXiv:2204.12000v2 PDF p. 1
  • Hipótesis, alcance foundation/white-box y contribuciones: PDF pp. 2–4, Introduction
  • Big Five, cuestionario y scoring humano de referencia: PDF pp. 6–7, section 3.1 and Table 1
  • Clasificador NLI zero-shot no identificado: PDF pp. 7–8, section 3.3
  • Modelos y descripciones de entrenamiento: PDF pp. 8–9, section 3.4
  • Tres enfoques ZSC, etiquetas y transformación de scores: PDF pp. 10–11, section 4.1 and Table 2
  • Treinta respuestas por prompt y protocolo de modelos: PDF pp. 11–12 and 16, sections 4.2 and 5.2
  • Dos métodos de fine-tuning: PDF pp. 12–13 and 21–22, sections 4.3 and 5.4
  • Corpus, porcentajes y fragmentación: PDF pp. 14–16, section 5.1, Table 3 and Figure 4
  • Scores comparativos de seis modelos: PDF pp. 16–18, section 5.2, Table 5 and Figures 5–6
  • Sensibilidad al segmento textual: PDF pp. 19–20, Table 6 and Figure 7
  • WebText frente a GPT-2 con y sin prompt: PDF pp. 19–21, section 5.3, Table 7 and Figure 8
  • Resultados Method 1 y contradicciones Method 2: PDF pp. 22–23, Tables 8–9 and Figure 9
  • Resultados completos por rasgo y umbral: PDF pp. 28–29, Appendix Tables A.10–A.13
  • Cincuenta prompts completos: PDF p. 30, Table A.14
  • Inspección visual: All 30 PDF pages rendered and visually inspected, including all nine figures and fourteen tables; checked 15 Jul 2026
  • Estado de publicación y ausencia de implementación enlazada: arXiv, SSRN record, PDF references and targeted title/arXiv-ID repository search; checked 15 Jul 2026