Kovač y coautores estudian una pregunta más precisa que si un LLM «posee valores»: hasta qué punto conserva el orden de los valores que expresa cuando cambia un contexto conversacional aparentemente ajeno. Administran el Portrait Values Questionnaire de 40 ítems (PVQ-40) a 21 modelos de seis familias, después de conversaciones sobre gramática, chistes, poesía, historia o ajedrez. En una condición cada modelo representa a 60 personajes de Tolkien o 50 personas famosas; en otra no recibe persona. El modelo evaluado conversa con otra instancia del mismo modelo y, para cada pregunta, se elige la letra A–F con mayor puntuación de siguiente token. Los scores se centran por participante y se agregan en los diez valores de Schwartz.
La estabilidad rank-order pregunta si las diferencias entre personas simuladas se ordenan igual entre dos temas: por ejemplo, si quienes expresan más tradición en un contexto siguen ocupando posiciones altas en otro. La estabilidad ipsativa pregunta si el orden de los diez valores dentro de una misma respuesta se conserva entre contextos. Son propiedades distintas. Un modelo puede mantener un perfil interno parecido y, a la vez, representar mal las diferencias entre personas; también puede obtener una correlación alta aunque el perfil sea sistemáticamente incorrecto. Por eso el resultado debe leerse como estabilidad de respuestas PVQ bajo este protocolo, no como evidencia de valores internos.
Con personas ficticias, el mayor rank-order medio es Mixtral-8x7B-Instruct (r=0,43), seguido por su variante 4-bit (0,30), Mistral-7B-Instruct-v0.2 (0,28), Qwen-72B (0,24) y GPT-3.5-1106 (0,20). Con personas reales, Mixtral-Instruct alcanza 0,50 y Qwen-72B 0,46. Los Llama-2 y Phi quedan cerca de cero. Sin persona, la estabilidad ipsativa es mayor: Mixtral-Instruct llega a 0,84, su variante cuantizada a 0,82, Qwen-72B a 0,73 y Zephyr a 0,62. Esto no implica equivalencia humana: los referentes humanos proceden de cambios longitudinales durante años, mientras aquí se correlacionan respuestas sintéticas tras cambios de tema. Los propios autores limitan la comparación a identificar modelos claramente por debajo de esos referentes.
En el único experimento de longitud, realizado con Mixtral-8x7B-Instruct y personajes ficticios, el rank-order cae de 0,42 con tres mensajes a 0,15 con 43; la estabilidad ipsativa permanece alta. El análisis de perfiles neutrales sugiere que las personas convergen hacia un perfil por defecto: conservar el orden intrapersonal no significa conservar identidades diferenciadas. Tres tareas conductuales creadas por los autores reproducen parcialmente la jerarquía de familias, pero con techos muy distintos. Religión es la más estable (máximos de 0,66–0,68), donación es moderada (máximo 0,31) y robo apenas llega a 0,16. Las correlaciones esperadas entre PVQ y donación aparecen para universalismo, benevolencia, poder y logro, pero ninguna supera 0,3.
La contribución sólida es metodológica: hace visible que una puntuación psicológica de contexto mínimo no caracteriza por sí sola el comportamiento posterior y separa estabilidad interpersonal de intrapersonal. La evidencia comparativa, sin embargo, es exploratoria. Los temas, personas y tareas son muestras de conveniencia; los contextos son generados por el propio modelo; las configuraciones de muestreo difieren entre familias; no se valida la estructura psicométrica del PVQ en LLM; y las explicaciones sobre tamaño, datos, SFT, DPO, RLHF, cuantización o alignment son observacionales y confundidas. La auditoría del código encuentra además tests t independientes sobre unidades emparejadas, promedios directos de correlaciones de Spearman y una corrección BH que incluye 21 diagonales además de las 210 comparaciones declaradas. La etiqueta oficial v1.0 no contiene data ni results; el repositorio posterior recupera los estímulos, pero no los outputs de los modelos. Por tanto, el estudio apoya que este protocolo detecta una fuerte sensibilidad contextual y diferencias descriptivas entre checkpoints; no demuestra valores internos, causalidad de entrenamiento, estabilidad conductual general ni reproducibilidad independiente de las cifras publicadas.