PVNI propone convertir activaciones internas en cinco puntuaciones OCEAN supuestamente neutras al prompt. Para cada rasgo, genera respuestas bajo instrucciones positivas, negativas y neutrales; promedia el hidden state de una capa y posición fijas; define el eje como activación positiva menos negativa; proyecta el vector neutral sobre ese eje; recorta el coeficiente a [0,1] y lo usa para interpolar entre dos puntuaciones extremas asignadas por GPT-4.1-mini. GPT-5.2 genera los prompts contrastivos y las preguntas. La intuición geométrica es clara: ubicar la respuesta “neutral” entre dos extremos creados explícitamente.
El experimento compara PVNI con IPIP-BFFM-50, IPIP-NEO-120 y evaluación abierta juzgada por API en Qwen-2.5-7B-Instruct, Llama-3-8B-Instruct y Mistral-7B-v0.1-Instruct. Para cada protocolo usa diez conjuntos de prompts en dos familias: reescrituras de preguntas y variantes de role-play. El resultado favorable es consistente: la desviación estándar de PVNI es la menor en las 30 combinaciones modelo×rasgo×familia. Por ejemplo, en Qwen bajo reescritura, PVNI da O 83,55±0,82, C 87,63±0,73, E 42,89±2,49, A 93,39±0,68 y N 36,45±0,83, mientras IPIP-BFFM alcanza desviaciones entre 5,9 y 18,1. En Mistral, el caso más inestable de PVNI es extraversión, 60,15±5,89, frente a 36,98±24,86 con evaluación abierta. La evidencia sostiene que el pipeline es menos sensible a este conjunto controlado de reformulaciones.
No demuestra que las puntuaciones sean más verdaderas, psicométricamente válidas o conductualmente predictivas. No existe ground truth, panel humano, evaluación de comportamiento, validez convergente/discriminante, estructura factorial ni criterio externo. Los métodos discrepan ampliamente en medias: para extraversión de Mistral, IPIP-BFFM da 75, IPIP-NEO 70,83, evaluación abierta 36,98 y PVNI 60,15. Sin criterio no puede decidirse cuál describe mejor al modelo. Una salida constante también tendría varianza cero; estabilidad es una propiedad necesaria para algunas mediciones, no evidencia suficiente de validez.
Parte de la estabilidad es estructural. PVNI promedia preguntas, respuestas y activaciones, proyecta sobre un único eje, recorta coeficientes fuera de [0,1] e interpola entre promedios extremos. No se publica cuántos casos son recortados ni una ablación sin clipping, con menos prompts o con otras capas. Los prompts positivos y negativos ya definen el rasgo que el juez debe detectar; el método mide dónde cae el neutral entre esos endpoints construidos. Llamarlo “personalidad interna” confunde una coordenada relativa al conjunto de prompts con una disposición intrínseca e independiente de la tarea.
La teoría formal no valida empíricamente PVNI. Parte de supuestos fuertes: linealidad local del score, persona bien adaptada mediante un cambio de parámetros, actualización aproximadamente de rango uno y, para generalización, una base OCEAN ortonormal. El experimento usa prompting, no los modelos persona-adaptados del supuesto 2; no verifica rango uno, ortogonalidad, límites de error, composición, negación ni síntesis fuera de dominio. La propia sección de limitaciones admite que los ejes están correlacionados y que lo neutral puede no estar sobre el eje positivo-negativo. Por tanto, los teoremas expresan consecuencias condicionales de supuestos, no una demostración de que esos supuestos se cumplan.
“Explainable” significa que el cálculo puede describirse como proyección e interpolación. No se identifica qué neuronas, tokens, capas o mecanismos causan conducta, no se prueba fidelidad de la explicación y ni siquiera se especifican en el paper la capa l o posición de probe empleadas. No hay análisis de sensibilidad por capa/token, estabilidad temporal, decodificación repetida, contexto largo, diálogo, idiomas, tamaños o modelos mayores. El requisito de activaciones limita PVNI a modelos white-box.
El preprint no enlaza código, checkpoints de artefactos, prompts completos para los cinco rasgos, conjuntos train/evaluation, salidas, scores del juez o configuración ejecutable. Faltan snapshots de GPT-4.1-mini y GPT-5.2, fecha, temperatura, seeds, capa, posición y procedimiento reproducible para el promedio ponderado por logits de enteros 0–100. Con solo tablas y ejemplos parciales no se pueden reconstruir los resultados. PVNI es una propuesta prometedora para robustez de representaciones, pero todavía no es una evaluación validada de personalidad LLM ni un referente operativo listo para comparar modelos.