Este preprint compara dos formas de perfilar ocho LLM abiertos en diez valores de Schwartz y los cinco rasgos Big Five. La primera administra PVQ-40, PVQ-21, BFI-44 y BFI-10 como autoinformes Likert, con dos órdenes de opciones contrabalanceados. La segunda calcula la suma de log-probabilidades de respuestas candidatas fijas del dataset Value Portrait: 520 pares procedentes de 104 consultas reales de ShareGPT, LMSYS, Reddit y Dear Abby, validados previamente con 681 participantes; 286 pares se etiquetan con valores y 228 con rasgos cuando la correlación humana alcanza r ≥ 0,3. Los modelos son Gemma 3 4B/27B, Qwen 2.5 7B/72B, Qwen 3 30B-A3B/235B-A22B y GPT-OSS 20B/120B. El trabajo encuentra alta concordancia de rango entre versiones largas y cortas del mismo tipo de cuestionario, Spearman medio 0,74 para PVQ y 0,77 para BFI, pero concordancia menor con el perfil de generación: 0,31/0,28 para valores y 0,26/0,11 para rasgos. Los cuestionarios también muestran mucha más estructura entre ítems que Value Portrait. En una prueba de reconocimiento de constructos, siete modelos obtienen F1 media 0,69–0,83 en instrumentos establecidos y 0,09 en VP; cinco encoders asignan el constructo correcto a 77–81% de los ítems establecidos, frente a 11–26% de VP. Esta es la evidencia más sólida: la redacción de los cuestionarios revela de forma muy explícita qué dimensión se mide y permite respuestas coherentes con el constructo sin demostrar una disposición estable. En ocho personas demográficas, género, edad, ideología y educación, los desplazamientos medios del PVQ se parecen a diferencias marginales de ESS: coseno medio 0,60 para PVQ-40 y 0,47 para PVQ-21, con 62/80 y 55/80 signos coincidentes. VP obtiene coseno medio −0,03, coseno agregado 0,007 con IC bootstrap del 95% [−0,221, 0,236] y 40/80 signos, indistinguible de 50%. Los desplazamientos normalizados del cuestionario son 0,67/0,71 frente a 0,20 en humanos y 0,37 en VP; esta medida es una magnitud relativa dentro del perfil, no Cohen’s d. La interpretación debe ser más estrecha que el título. Value Portrait no observa generación libre: puntúa cinco respuestas preescritas por consulta, suma log-probabilidades sin normalizar por longitud y luego promedia por escenario y constructo. La validación de cobertura solo comprueba el candidato VP mejor situado entre diez muestras libres; su mediana global es rango 4, pero varía de 1 a 11 según modelo y no valida los cinco candidatos ni el promedio de cada constructo. Los perfiles comparados usan instrumentos, ítems, escalas y estimadores distintos. Además, con solo cinco rasgos Spearman es discreto; los ocho modelos pertenecen a cuatro familias relacionadas; NDCG rompe empates Likert con el orden arbitrario de argsort; y la fila agregada de RQ2 es la mediana de ocho p-valores, no una prueba conjunta. En RQ4, las 80 señales no son ensayos independientes: los pares de personas son opuestos, los perfiles se centran y los valores de Schwartz están correlacionados. Las diferencias marginales de ESS tampoco aíslan efectos causales de edad, educación, política o país. El propio paper reconoce que no existe un baseline humano emparejado para RQ1–RQ3 y que el método de probabilidad es una medición controlada entre cuestionario y generación abierta. Código y datos se prometen para cuando se publique; a 15 de julio de 2026 el trabajo figura como under review y no se localizaron artefactos del estudio. La conclusión defendible es que los cuestionarios humanos pueden medir con mucha fuerza la habilidad del modelo para reconocer el significado y la deseabilidad de sus ítems, y no bastan como prueba de rasgos estables o conducta futura. El estudio no demuestra todavía que VP sea una medida más exacta de comportamiento real ni que sus perfiles predigan generación libre.
Pregunta de investigación
¿Hasta qué punto los perfiles de valores y rasgos obtenidos al pedir autoinformes Likert a LLM coinciden con perfiles construidos desde probabilidades de respuestas a consultas realistas, por qué los cuestionarios parecen internamente coherentes y si sus desplazamientos bajo personas demográficas se trasladan a esa conducta generativa controlada?