Este estudio pregunta si los LLM pueden construir redes de amistad sintéticas con una estructura parecida a redes reales y qué sesgos demográficos introducen al elegir vínculos. No estudia personalidad. Sus “personas” son 50 perfiles demográficos sintéticos con género, edad, raza/etnia, religión y afiliación política; no contienen rasgos psicológicos, cuestionarios, historias de vida ni datos de individuos reales. En la muestra principal hay 24 demócratas y 26 republicanos, sin independientes, por lo que el contraste político central es binario.
Los autores comparan tres formas de prompting sin entrenamiento adicional. Global pide toda la red en una sola respuesta. Local asigna al modelo una persona cada vez y le pide escoger amistades entre los demás perfiles, sin información de la red. Sequential también actúa persona por persona, pero muestra el grado o la lista actual de amigos de cada candidato. Las tres condiciones usan los mismos 50 perfiles. Para el análisis principal se generan 30 redes por método a temperatura 0,8. Se prueban GPT-3.5 Turbo y GPT-4o, Llama 3.1 de 8B y 70B y Gemma 2 de 9B y 27B; el texto principal presenta GPT-3.5 Turbo porque fue el que mejor se aproximó a las referencias estructurales.
La “realidad” estructural se define mediante ocho redes de amistad de CASOS y KONECT, muy distintas entre sí y pequeñas: tienen entre 31 y 70 nodos y entre 63 y 274 aristas. Se comparan densidad, clustering medio, proporción del mayor componente conectado, camino mínimo medio, modularidad y distribución de grado. Global produce redes demasiado poco densas y conectadas, con poco clustering, demasiada modularidad y sin la cola larga de grados. Local y Sequential se solapan mejor con las distribuciones de referencia. Sequential capta mejor la cola larga porque recibe información acumulada de la red. El paper reporta una distancia KS media de 0,330 para Sequential frente a 0,499 para el mejor comparador clásico ajustado, small-world; 0,499 es un 51 % mayor. Este resultado significa semejanza en las métricas seleccionadas, no realismo social general ni validación de dinámicas como difusión, contagio o influencia.
La homofilia se mide como la proporción observada de aristas entre grupos dividida por la esperada según el tamaño de los grupos; valores inferiores a 1 indican menos vínculos cruzados y, por tanto, más homofilia. En GPT-3.5 Turbo, Local obtiene 0,180 para vínculos entre partidos y Sequential 0,340: un 82 % y un 66 % menos de aristas entre demócratas y republicanos de lo esperado bajo ese nulo. Las proporciones de vínculos dentro del mismo partido son 1,851 y 1,685; los índices de aislamiento 0,729 y 0,530; y las medidas de polarización 0,639 y 0,515. La afiliación política resulta el separador más fuerte en los seis modelos. GPT-4o y Llama 3.1 70B llegan en algunas redes a cero aristas entre partidos, dividiendo el grafo en dos componentes políticos.
El dominio político no desaparece al barajar las asociaciones entre variables demográficas ni al presentar variables de una en una o por parejas. En una condición que pide una razón libre para cada amistad, la afiliación política aparece en el 86,7 % de las razones, la religión en el 43,0 %, la edad en el 21,8 %, raza/etnia en el 12,1 % y género en el 7,3 %. Esas razones son explicaciones generadas por el propio modelo y clasificadas con otro LLM, no evidencia causal validada sobre su mecanismo interno. Tampoco funciona como corrección automática añadir intereses: los intereses se generan a partir de los mismos datos demográficos y reproducen estereotipos políticos, por lo que la política sigue siendo el factor dominante.
La afirmación de que los modelos “sobreestiman” homofilia política requiere un matiz central. Las ocho redes usadas para evaluar estructura no incluyen atributos demográficos por nodo, así que no permiten una comparación política directa. El paper contrasta las redes generadas con cifras publicadas en otros trabajos sobre Twitter, asociaciones voluntarias, trabajo, vecindarios, familia, personas de confianza y discusión política. Son poblaciones, épocas, definiciones de vínculo y contextos distintos. Los valores generados son más extremos que todos los referentes citados, pero no proceden de una réplica emparejada sobre las mismas redes. El propio apéndice muestra que la homofilia real de raza/etnia, religión, edad y género varía mucho entre estudios; para algunas variables el LLM puede incluso subestimarla.
La auditoría del repositorio confirma una parte importante y limita otra. En el commit a841a29 se publican las 30 redes Global, Local y Sequential de GPT-3.5 Turbo y GPT-4o, la muestra de 50 personas, datos reales, estadísticas y un notebook. Al recalcular los tres CSV de homofilia de GPT-3.5 Turbo desde las redes liberadas, todas las filas coinciden exactamente; las medias políticas 0,180 y 0,340 quedan verificadas. También coinciden las métricas estructurales salvo modularidad: la función Louvain no fija semilla y produce diferencias de hasta 0,018-0,027 entre ejecuciones. No se publican las redes crudas de Llama/Gemma, la mayoría de ablaciones, la muestra de 1.000 personas usada para prevalencia de intereses ni los grafos clásicos de Table B1, de modo que esas partes sólo pueden contrastarse con estadísticas derivadas.
El entorno público no funciona tal como está documentado. requirements.txt exige a la vez Pillow 9.3.0 y 10.4.0, y fija numpy 1.23.4 aunque scipy 1.14.1 exige al menos 1.23.5. Los módulos de análisis intentan leer api-key.txt al importar incluso para trabajo offline. El comando README para generar personas usa un argumento --save_name que la CLI no acepta, y la CLI de análisis falla en plotting.py con NameError: SHOW_PLOTS is not defined. No hay tests, CI, lockfile, contenedor, tags ni licencia; los nombres de modelo son alias mutables y no se informan fechas de ejecución.
La conclusión fiel es que, en esta muestra demográfica estadounidense simplificada y bajo estos prompts, los LLM generan grafos localmente plausibles pero exageran la separación demócrata-republicano; el efecto principal de GPT-3.5 se sostiene en los artefactos públicos. No demuestra personalidad sintética, preferencias de amistad humanas, una red representativa de Estados Unidos, causalidad del pretraining, generalización cultural, efectos de difusión ni reproducción completa de todos los modelos y anexos.