Este artículo de EMNLP 2025 propone MARK, un pipeline de prompting de varias llamadas para predecir respuestas individuales y distribuciones agregadas del World Values Survey. No mide personalidad ni estrés en los participantes. Primero, un LLM asigna a cada atributo demográfico un nivel de estrés de 0 a 100 y resume el perfil; después infiere funciones cognitivas MBTI dominante y auxiliar, completa las funciones terciaria e inferior mediante reglas; genera una respuesta y un peso bajo cada función; y otro paso revisa, repondera y sintetiza la opción final. Por tanto, estrés, personalidad, trayectoria cognitiva y explicación son texto generado por el modelo, no observaciones psicológicas. El paper usa WVS Wave 7 de Estados Unidos y China, declara 30 rasgos demográficos, 20 clusters, 400 sujetos y 102.800 pares pregunta-respuesta en EE. UU., y 20 sujetos/4.340 pares en China. Compara GLM-4-air, GPT-4o-2024-08-06 y Doubao-1.5-pro a temperatura 0,9, sin repeticiones ni incertidumbre publicada. En la distribución muestreada de EE. UU., MARK obtiene 33,69 %, 38,11 % y 46,98 % de accuracy. Frente al baseline de mayor accuracy de cada modelo, las ganancias reales son 6,71, 1,15 y 15,53 puntos, no un 10 % uniforme. La prosa de Section 5.2 tampoco coincide con Table 2: contra Demo.+Ideo.+Opiniontop3, la tabla da +8,63, +5,04 y +15,53 puntos, no +4,3, +8,9 y +15,5. En China, MARK no es el método más preciso con GLM: 31,58 % frente a 35,21 % con prompts chinos y 31,37 % frente a 35,60 % con prompts ingleses, aunque el caption afirma superioridad general. La auditoría del artefacto cambia además la interpretación metodológica. El notebook de extracción no agrupa por los 30 datos demográficos descritos: usa únicamente SACSECVAL y RESEMAVAL, índices WVS de valores seculares y emancipativos derivados de las respuestas. La selección de grupos y representantes está así informada por el dominio objetivo. El mismo notebook fija 5 clusters, no 20, selecciona como máximo 20 personas en cada uno, no define seed, llama a drop_duplicates sin conservar el resultado y etiqueta una curva SSE como silhouette analysis. La llamada personalidad oracle tampoco es personalidad medida: personal_assign.py recorre Q1-Q258, usa las respuestas reales del sujeto, incluida cada pregunta objetivo, y acumula probabilidades de personalidad generadas por otro LLM. Table 17 compara el predictor con esa etiqueta sintética filtrada por respuestas; 70 % de acierto a nivel de role y 15/31 % a nivel de type no valida MBTI. De hecho, el análisis de robustez muestra que asignaciones random, predicted y oracle producen curvas casi solapadas, y el propio texto dice que la similitud de personalidad tiene influencia mínima. Esto debilita la atribución causal a la personalidad. Las métricas publicadas tampoco cuentan con una implementación válida. El notebook calcula 1 menos la distancia Jensen-Shannon de SciPy, no 1 menos la divergencia que nombra. Para EMD pasa los vectores de masas como posiciones muestrales a wasserstein_distance; dos distribuciones binarias invertidas [0,7, 0,3] y [0,3, 0,7] reciben así distancia cero en vez de 0,4 sobre soportes ordenados. El script de kappa entrega recuentos por opción a cohen_kappa_score como si fueran etiquetas de dos jueces, y el paper alterna Cohen y Fleiss. Se muestran p-values aislados, incluido 0,6, pero no se publica test, unidad muestral, código, predicciones, repeticiones, intervalos, bootstrap ni corrección múltiple. El repositorio omite WVS, muestras, outputs, resultados y requirements.txt; los tres notebooks tienen cero celdas ejecutadas y cero outputs. Paper, README y código nombran respectivamente Gemini-2-pro, Gemini-2.5 y gemini-1.5-flash-exp-0827; el script de augmentación falla en print(a), duplica append en memoria y los 21 JSON publicados contienen 1.254 objetos de probabilidad vacíos. El runner central expone además una credencial API no placeholder, que debe considerarse comprometida. La conclusión defendible es limitada: una estructura de deliberación con más llamadas y contexto puede cambiar y a veces mejorar predicciones sintéticas de encuestas, especialmente con Doubao. No se demuestra personalidad, estrés, cognición, interpretabilidad fiel, significación, generalización a demografías nuevas ni sustitución de encuestas humanas. Antes de usar MARK como evidencia psicológica o social se necesitan muestreo independiente de respuestas, métricas recalculadas a nivel de participante, constructos medidos o labels neutrales, tests held-out de personas/preguntas/grupos, ablations igualadas en cómputo, repeticiones, auditoría de estereotipos y artefactos completos.
Pregunta de investigación
¿Puede un pipeline multietapa inspirado en dinámica de tipos MBTI, que infiere estrés y funciones cognitivas desde demografía, mejorar la predicción zero-shot de respuestas y distribuciones del World Values Survey frente a prompts demográficos y de opiniones?