Stable and Explainable Personality Trait Evaluation in Large Language Models with Internal Activations

Evaluación y validez psicométrica2026arXivRevisión editorial aprobada

Autores: Xiaoxu Ma, Xiangbo Zhang, Zhenyu Weng

Palabras clave: Large Language Models, Personality, Persona, Personality Control, Model Evaluation

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

3
Autores
6
Hallazgos
30
Limitaciones
11
Evidencias

Resumen editorial

Español

PVNI propone convertir activaciones internas en cinco puntuaciones OCEAN supuestamente neutras al prompt. Para cada rasgo, genera respuestas bajo instrucciones positivas, negativas y neutrales; promedia el hidden state de una capa y posición fijas; define el eje como activación positiva menos negativa; proyecta el vector neutral sobre ese eje; recorta el coeficiente a [0,1] y lo usa para interpolar entre dos puntuaciones extremas asignadas por GPT-4.1-mini. GPT-5.2 genera los prompts contrastivos y las preguntas. La intuición geométrica es clara: ubicar la respuesta “neutral” entre dos extremos creados explícitamente.

El experimento compara PVNI con IPIP-BFFM-50, IPIP-NEO-120 y evaluación abierta juzgada por API en Qwen-2.5-7B-Instruct, Llama-3-8B-Instruct y Mistral-7B-v0.1-Instruct. Para cada protocolo usa diez conjuntos de prompts en dos familias: reescrituras de preguntas y variantes de role-play. El resultado favorable es consistente: la desviación estándar de PVNI es la menor en las 30 combinaciones modelo×rasgo×familia. Por ejemplo, en Qwen bajo reescritura, PVNI da O 83,55±0,82, C 87,63±0,73, E 42,89±2,49, A 93,39±0,68 y N 36,45±0,83, mientras IPIP-BFFM alcanza desviaciones entre 5,9 y 18,1. En Mistral, el caso más inestable de PVNI es extraversión, 60,15±5,89, frente a 36,98±24,86 con evaluación abierta. La evidencia sostiene que el pipeline es menos sensible a este conjunto controlado de reformulaciones.

No demuestra que las puntuaciones sean más verdaderas, psicométricamente válidas o conductualmente predictivas. No existe ground truth, panel humano, evaluación de comportamiento, validez convergente/discriminante, estructura factorial ni criterio externo. Los métodos discrepan ampliamente en medias: para extraversión de Mistral, IPIP-BFFM da 75, IPIP-NEO 70,83, evaluación abierta 36,98 y PVNI 60,15. Sin criterio no puede decidirse cuál describe mejor al modelo. Una salida constante también tendría varianza cero; estabilidad es una propiedad necesaria para algunas mediciones, no evidencia suficiente de validez.

Parte de la estabilidad es estructural. PVNI promedia preguntas, respuestas y activaciones, proyecta sobre un único eje, recorta coeficientes fuera de [0,1] e interpola entre promedios extremos. No se publica cuántos casos son recortados ni una ablación sin clipping, con menos prompts o con otras capas. Los prompts positivos y negativos ya definen el rasgo que el juez debe detectar; el método mide dónde cae el neutral entre esos endpoints construidos. Llamarlo “personalidad interna” confunde una coordenada relativa al conjunto de prompts con una disposición intrínseca e independiente de la tarea.

La teoría formal no valida empíricamente PVNI. Parte de supuestos fuertes: linealidad local del score, persona bien adaptada mediante un cambio de parámetros, actualización aproximadamente de rango uno y, para generalización, una base OCEAN ortonormal. El experimento usa prompting, no los modelos persona-adaptados del supuesto 2; no verifica rango uno, ortogonalidad, límites de error, composición, negación ni síntesis fuera de dominio. La propia sección de limitaciones admite que los ejes están correlacionados y que lo neutral puede no estar sobre el eje positivo-negativo. Por tanto, los teoremas expresan consecuencias condicionales de supuestos, no una demostración de que esos supuestos se cumplan.

“Explainable” significa que el cálculo puede describirse como proyección e interpolación. No se identifica qué neuronas, tokens, capas o mecanismos causan conducta, no se prueba fidelidad de la explicación y ni siquiera se especifican en el paper la capa l o posición de probe empleadas. No hay análisis de sensibilidad por capa/token, estabilidad temporal, decodificación repetida, contexto largo, diálogo, idiomas, tamaños o modelos mayores. El requisito de activaciones limita PVNI a modelos white-box.

El preprint no enlaza código, checkpoints de artefactos, prompts completos para los cinco rasgos, conjuntos train/evaluation, salidas, scores del juez o configuración ejecutable. Faltan snapshots de GPT-4.1-mini y GPT-5.2, fecha, temperatura, seeds, capa, posición y procedimiento reproducible para el promedio ponderado por logits de enteros 0–100. Con solo tablas y ejemplos parciales no se pueden reconstruir los resultados. PVNI es una propuesta prometedora para robustez de representaciones, pero todavía no es una evaluación validada de personalidad LLM ni un referente operativo listo para comparar modelos.

English

PVNI proposes converting internal activations into five OCEAN scores intended to be prompt-neutral. For each trait, it generates responses under positive, negative, and neutral instructions; averages hidden states at a fixed layer and probe position; defines the axis as positive minus negative activation; projects the neutral vector onto that axis; clips the coefficient to [0,1]; and uses it to interpolate between two extreme scores assigned by GPT-4.1-mini. GPT-5.2 generates contrastive prompts and questions. The geometric intuition is clear: locate a “neutral” response between two explicitly constructed endpoints.

The experiment compares PVNI with IPIP-BFFM-50, IPIP-NEO-120, and API-judged open-ended evaluation on Qwen-2.5-7B-Instruct, Llama-3-8B-Instruct, and Mistral-7B-v0.1-Instruct. Each protocol uses ten prompt sets in two families: question rewrites and role-play variants. The favorable result is consistent: PVNI has the lowest standard deviation in all 30 model-by-trait-by-variant-family combinations. For Qwen question rewrites, for example, PVNI reports O 83.55±.82, C 87.63±.73, E 42.89±2.49, A 93.39±.68, and N 36.45±.83, whereas IPIP-BFFM standard deviations range from 5.9 to 18.1. On Mistral, PVNI's least stable case is extraversion at 60.15±5.89 versus 36.98±24.86 for open-ended evaluation. The evidence supports lower sensitivity to this controlled set of prompt reformulations.

It does not show that PVNI scores are truer, psychometrically valid, or behaviorally predictive. There is no ground truth, human panel, behavioral evaluation, convergent or discriminant validity, factor structure, or external criterion. Method means disagree sharply: for Mistral extraversion, IPIP-BFFM gives 75, IPIP-NEO 70.83, open-ended evaluation 36.98, and PVNI 60.15. Without a criterion, the study cannot determine which describes the model better. A constant estimator would also have zero variance; stability can be necessary for measurement but is not sufficient evidence of validity.

Some stability is structural. PVNI averages prompts, outputs, and activations, projects onto one axis, clips coefficients outside [0,1], and interpolates between averaged extremes. It does not report clipping frequency or ablate clipping, prompt count, layers, or probe positions. Positive and negative prompts already define the trait the judge is asked to detect; the method measures where neutral falls between constructed endpoints. Calling this “internal personality” conflates a coordinate relative to a prompt ensemble with an intrinsic, task-independent disposition.

The formal theory does not empirically validate PVNI. It assumes local score linearity, a well-trained persona parameter update, approximately rank-one amplification, and, when discussing generalization, an orthonormal OCEAN basis. The experiment uses prompting rather than the persona-adapted models in Assumption 2 and tests neither rank-one structure, orthogonality, error bounds, composition, negation, nor out-of-domain synthesis. The limitations themselves acknowledge correlated axes and that neutrality may not lie on the positive-negative axis. The theorems therefore state consequences conditional on assumptions, not evidence that those assumptions hold.

“Explainable” means the computation can be described as projection and interpolation. The paper does not identify neurons, tokens, layers, or mechanisms that cause behavior, test explanation fidelity, or even report the actual layer and probe position used. There is no layer/token sensitivity, temporal stability, repeated decoding, long-context, dialogue, multilingual, scale, or larger-model evaluation. Requiring activations restricts PVNI to white-box models.

The preprint links no code, artifact checkpoints, complete five-trait prompts, extraction/evaluation splits, outputs, judge scores, or executable configuration. GPT-4.1-mini and GPT-5.2 snapshots, dates, temperatures, seeds, layer, probe position, and the reproducible procedure for a logit-weighted average over integer tokens 0–100 are absent. Tables and partial examples are insufficient to reconstruct the results. PVNI is a promising representation-robustness proposal, but it is not yet a validated LLM personality assessment or an operational benchmark for model comparison.

Pregunta de investigación

¿Puede una proyección del hidden state neutral sobre un eje positivo-negativo construido con prompts producir puntuaciones OCEAN menos variables ante reformulaciones que cuestionarios y evaluación abierta?

Método

Para cada rasgo y modelo, PVNI genera respuestas con prompts positivos, negativos y neutrales, promedia activaciones, proyecta neutral-negativo sobre positivo-negativo y recorta el coeficiente a [0,1]. Interpola entre anchors 0–100 juzgados por GPT-4.1-mini. Se compara desviación estándar sobre diez conjuntos de reescrituras o role-play con dos IPIP y una evaluación abierta en tres modelos 7B. GPT-5.2 genera prompts y preguntas.

Muestra: Tres modelos instruction-tuned de aproximadamente 7B, cinco rasgos y dos familias de diez prompt sets por protocolo. Se comparan cuatro protocolos, produciendo 30 combinaciones modelo×rasgo×familia para la afirmación de menor desviación. El paper informa unas dos horas GPU por modelo en RTX 4090, pero no número exacto de generaciones, rollouts del juez, ejemplos por split, tokens, seeds o frecuencia de clipping.

Hallazgos

  • PVNI presenta la desviación estándar más baja en todas las combinaciones publicadas de modelo, rasgo y tipo de variante.
  • En Qwen con reescrituras, las desviaciones PVNI son .82, .73, 2.49, .68 y .83 para O, C, E, A y N, menores que las de los tres baselines.
  • En Mistral con reescrituras, PVNI es muy estable salvo E ±5.89; aun así queda por debajo de open-ended E ±24.86 e IPIP-NEO E ±14.91.
  • Las variantes role-play suelen tener menor variabilidad que reescribir preguntas, incluso en los baselines.
  • Las medias difieren materialmente entre protocolos, de modo que la menor varianza no resuelve cuál puntuación es válida.
  • El artículo no aporta tests inferenciales, intervalos sobre diferencias de varianza, ground truth o correlación con conducta.

Limitaciones

  • Optimiza y evalúa estabilidad, no validez. Un estimador constante sería estable y no mediría el constructo.
  • No existe referencia humana, behavioral benchmark, intervención causal, criterio externo o perfil conocido para evaluar exactitud.
  • No se estudian validez convergente, discriminante, predictiva, incremental, factorial o invariancia entre modelos.
  • Las medias de los cuatro protocolos discrepan ampliamente; el paper no ofrece regla para escoger la medida correcta.
  • Los extremos positivo y negativo se imponen con prompts y son puntuados por un juez que conoce el rasgo, creando una calibración circular.
  • El neutral también es un prompt diseñado. No representa una ausencia natural o identificada de rasgo.
  • Proyección, promedio, clipping e interpolación comprimen varianza por construcción. No se publica frecuencia de clipping ni ablaciones.
  • Si neutral cae fuera del segmento o el eje es curvo/multimodal, recortar oculta el fallo en vez de calibrarlo; los autores reconocen el supuesto.
  • Las direcciones OCEAN pueden estar correlacionadas y no ser ejes independientes, por lo que scores por rasgo pueden mezclar constructos.
  • No se reportan correlaciones entre vectores, separación entre rasgos, leakage entre prompts o estabilidad del eje entre datasets.
  • La capa de extracción y posición fija del probe no se identifican; tampoco hay análisis de sensibilidad por capa, token o agregación.
  • La afirmación de que activaciones de respuesta son mejores que tokens de prompt no va acompañada de resultados comparativos.
  • La teoría supone linealidad local y adaptación paramétrica bien entrenada; los experimentos con prompting no verifican esos supuestos.
  • El supuesto de base OCEAN ortonormal en el teorema de generalización entra en tensión con la admisión de ejes correlacionados.
  • Composición, negación y síntesis fuera de dominio se formulan teóricamente pero no se prueban empíricamente.
  • Los límites contienen constantes y términos O(.) no estimados; no predicen error o calibración del experimento real.
  • “Explainable” describe una operación geométrica, pero no se evalúan fidelidad, causalidad, localización mecanística o comprensibilidad humana.
  • GPT-4.1-mini sigue determinando los anchors absolutos; sesgo y drift del juez pasan directamente a las puntuaciones.
  • No se especifica cómo se obtiene una media ponderada por logits sobre los 101 enteros posibles ni qué ocurre si tokens no están disponibles.
  • GPT-5.2 genera los prompts usados para demostrar robustez; no hay generación independiente, auditoría humana o adversarial del conjunto.
  • Las preguntas abiertas alternativas no son paráfrasis sino probes distintos, por lo que también cambian facetas semánticas del rasgo.
  • Solo hay diez sets por familia, sin justificación de cobertura, muestreo aleatorio o intervalos de incertidumbre de la varianza.
  • No se reportan tests de igualdad de varianzas, bootstrap, tamaños de efecto de estabilidad o corrección por múltiples comparaciones.
  • Se comparan tres modelos pequeños de una época similar; no hay tamaños mayores, base models, MoE, otras familias o closed models.
  • Solo cubre inglés, Big Five, single-turn y prompts controlados; no prueba temporalidad, contexto largo, conversación o tool use.
  • Necesita acceso white-box a activaciones y por ello no puede aplicarse directamente a APIs cerradas.
  • El coste no se compara de forma normalizada con baselines; promediar más muestras puede comprar estabilidad con más cómputo.
  • Faltan IDs exactos de checkpoints, versiones de transformers, decoding, precisión numérica, seeds y detalles de hardware/software.
  • No se encontró repositorio o artefacto oficial enlazado; faltan código, prompts completos, splits, outputs y resultados máquina-legibles.
  • El estado es preprint arXiv v1, sin venue o revisión por pares indicada en la superficie oficial consultada.

Qué no demuestra

  • No establece que PVNI mida personalidad LLM verdadera, intrínseca o estable fuera de sus prompts.
  • No demuestra que menor desviación implique mayor exactitud o validez psicométrica.
  • No prueba que las puntuaciones OCEAN correspondan a conducta, decisiones o interacción del modelo.
  • No demuestra que los ejes sean independientes, lineales, causales o generalicen fuera del conjunto de prompts.
  • No valida empíricamente los teoremas de composición, negación o síntesis fuera de dominio.
  • No produce una evaluación judge-invariant ni aplicable a modelos cerrados.
  • No permite reproducir los números publicados desde artefactos públicos identificados.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2601.09833v1, submitted 14 January 2026; preprint, 17 pages

Fuente consultada: https://arxiv.org/pdf/2601.09833v1

Revisión: Codex full-text, bilingual-fidelity, 17-page visual, arXiv-v1, internal-activation, construct-validity, psychometric-validity, variance-vs-accuracy, clipping, judge-circularity, hidden-layer, theoretical-assumption, generalization-claim, prompt-coverage, compute-fairness and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Qwen-2.5-7B-Instruct
  • Llama-3-8B-Instruct
  • Mistral-7B-v0.1-Instruct
  • GPT-4.1-mini external trait judge, unspecified snapshot
  • GPT-5.2 prompt and question generator, unspecified snapshot

Instrumentos y métricas

  • Persona-Vector Neutrality Interpolation
  • Positive, negative and neutral contrastive persona prompts
  • Hidden-state mean-difference persona vectors
  • Clipped projection coefficient and anchor interpolation
  • IPIP-BFFM-50 self-report baseline
  • IPIP-NEO-120 self-report baseline
  • Open-ended elicitation with API judge
  • Big Five OCEAN coordinates
  • Standard deviation, IQR and boxplots over prompt sets

Datos utilizados

  • Ten generated questionnaire-variant prompt sets per protocol
  • Ten generated role-play-variant prompt sets per protocol
  • Open-ended trait questions split into extraction and evaluation sets, unreleased
  • Five-trait contrastive prompt ensembles, only partial examples published

Evidencia y localización

  • Metadatos, abstract y estado: arXiv:2601.09833v1 abstract page, submitted 14 January 2026
  • Definición, proyección, clipping e interpolación: Paper, pp. 3–4, Section 3 and Algorithm 1
  • Supuestos y teoría lineal: Paper, pp. 4–6, Section 4, Assumptions 1–2 and Theorems 4.1–4.3
  • Modelos, jueces, artefactos, hardware y muestra de prompts: Paper, p. 7, Section 5.1 Experimental Settings
  • Resultados de estabilidad Qwen y Llama: Paper, pp. 7–8, Table 1 and Figures 3–4
  • Resultados de estabilidad Mistral: Paper, p. 16, Table 2
  • Variantes y cobertura de prompt: Paper, pp. 12–15, Appendix A.1
  • Boxplots y análisis de robustez: Paper, pp. 15–17, Appendix A.2–A.3 and Figures 5–7
  • Limitaciones reconocidas: Paper, p. 9, Section 7 Limitations
  • Inspección visual integral: Paper, all 17 rendered pages, including every equation, table, plot and appendix page
  • Ausencia de código oficial enlazado: Paper and official arXiv surface checked 15 July 2026; no repository or executable artifact identified