El artículo presenta German General Social Survey Personas (GGSS Personas), nombre adoptado en la versión 2 para la colección antes llamada German General Personas. Convierte en prompts los registros de 5.246 participantes de ALLBUScompact 2023. Cada persona contiene un bloque sociodemográfico fijo y un bloque TOP-k. Para construir este último, los autores eliminan paradata, campos sociodemográficos y 27 variables elegidas como resultados; después entrenan 406 random forests, cada uno con las otras 405 variables, y agregan las diez importancias principales de cada modelo. De ahí sale un ranking global de 380 atributos y versiones con k entre 2 y 380. Como el cuestionario se reparte en módulos, las personas están incompletas: TOP-2 contiene de media 1,34 atributos y TOP-380, 242,27; a partir de TOP-16 ninguna persona tiene todos los atributos posibles.
La evaluación pide a cinco modelos abiertos, Mistral-7B-Instruct-v0.3, Llama-3.1-8B-Instruct, Qwen3-8B, Gemma-3-12B-it y Llama-3.3-70B-Instruct, que respondan 27 preguntas, tres en cada uno de nueve temas. La variable objetivo no aparece literalmente en el prompt. Las respuestas individuales se agregan y se comparan con la distribución observada mediante distancia de Jensen-Shannon (JSD). Los baselines son random forests con los mismos conjuntos TOP-k y entre 2 y 2.048 ejemplos de entrenamiento; el 20% de los participantes se reserva como test. No se publican semillas, repeticiones, intervalos ni pruebas de significación. Llama-3.3-70B con TOP-2 es la mejor configuración observada. Supera al mejor random forest probado en 13 de 27 preguntas y en la media de cinco de nueve temas cuando el baseline usa hasta 512 casos. Añadir atributos no mejora de forma monótona y a menudo empeora la JSD.
El resultado sobre representatividad es más débil que la narrativa del recurso: al comparar una submuestra ALLBUS de 500 personas con submuestras sobrerrepresentadas por ingresos, conservadurismo o estudiantes, PersonaHub y ausencia de persona, las distribuciones quedan próximas y el propio artículo concluye que la representatividad tiene poca influencia en esa prueba. Además, se agregan respuestas sin informar uso de pesos, aunque el archivo oficial describe un muestreo probabilístico multietápico, estratificado y desproporcional. Por tanto, el objetivo empírico es la distribución bruta de participantes ALLBUS 2023, no una estimación demostrada de toda la población alemana. La JSD marginal tampoco mide acierto individual, fidelidad por subgrupos, dependencias multivariantes ni comportamiento real. El texto es ambiguo sobre si el LLM se compara sobre las 5.246 personas mientras el random forest se evalúa solo en el 20% de test, y no explica cómo trata el 1,44-9,91% de respuestas inválidas.
La colección ofrece formato clave-valor y prosa generada por Gemini. Dos coautores revisan 80 personas de TOP-2 a TOP-16 y consideran fieles 69: 11, o 13,75%, contienen omisiones o representaciones erróneas. No se informa acuerdo entre anotadores y no se valida sistemáticamente TOP-32 o superiores. El apéndice reconoce bucles graves en TOP-380. La auditoría del ZIP público de GitHub, commit de 22 de enero de 2026 y por tanto no necesariamente idéntico al archivo GESIS posterior, cuantifica el problema: hay filas de más de 100.000 caracteres en 5 personas TOP-64, 11 TOP-128, 79 TOP-256 y 556 TOP-380; esta última versión tiene 690 filas por encima de 10.000 caracteres y alcanza 446.981. También existe una fila TOP-16 de 66.349 caracteres dominada por un símbolo repetido. Los JSONL parsean y tienen el número esperado de filas, pero eso no garantiza fidelidad semántica.
GESIS preserva el dataset como ZA9089 v1.0.0 con DOI y codebook. Sin embargo, el repositorio público no incluye el código de construcción o evaluación, revisiones de modelos, semillas, generaciones, decisiones sobre inválidos ni datos de figuras. Su README aún usa el nombre antiguo, ofrece una URL de clonación de plantilla, deja cita y contacto como TBA y menciona un LICENSE inexistente. El paper dice Gemini-2.5-flash y la ficha GESIS, Gemini-2.5-flash-lite. ALLBUScompact reduce detalle y elimina geografía fina, pero la edición oficial conserva un respid enlazable y combinaciones sensibles de hogar, ingresos, migración, religión y política; esto deja riesgo residual de enlace e inferencia, sin que esta auditoría afirme una reidentificación. La contribución sólida es un corpus versionado y un benchmark preliminar de alineamiento agregado. No demuestra gemelos digitales fieles, sustitución de encuestas, representatividad universal ni reproducibilidad completa.