PersonaLedger combina un LLM con reglas Python para producir historiales sintéticos de tarjetas condicionados por personas textuales. Parte de los veinte campos de Nemotron-Personas y usa Llama-3.3-70B-Instruct, con siete ejemplos en contexto, para inferir nivel de ingresos, límite de crédito, hábito de pago, suscripciones, facturas, coche y patrón de gasto. Después genera día a día un plan narrativo y transacciones. El programa corrige el signo y una pequeña parte del importe, inserta cargos recurrentes, pagos e intereses, ofrece contexto de calendario estadounidense, vigila compras de combustible y alimentación y actualiza saldos. Es una simulación condicionada por persona; los planes no son observaciones de razonamiento humano ni validan personalidad psicológica.
El paper declara unos 30 millones de eventos de 23.361 usuarios sintéticos: 22.018 normales y 1.343 ilíquidos. Tabla 1 desglosa 24,7 millones de transacciones diarias, 1,9 millones de pagos y 4,30 millones de cargos recurrentes, con 74.623 comercios, una media de 724,05 días y 1.242,10 eventos por usuario. A partir de esos historiales crea clasificación de iliquidez a nivel de usuario y segmentación de robo de identidad a nivel de evento para ventanas de uno y tres meses. Declara 150.000 secuencias de entrenamiento y 36.000 de test por tarea. En iliquidez, el mejor AUC es 0,828 a tres meses y 0,804 a un mes; el mejor F1 es 0,216 y 0,208. En robo de identidad, el Transformer alcanza los mejores F1, 0,262 y 0,476, y el mejor AUC de un mes, 0,870; TimesNet logra 0,790 a tres meses.
La evidencia no valida las palabras realistic y privacy-preserving en su sentido fuerte. El realismo se argumenta con ejemplos y estadísticas internas por edad, educación, coche, hábito de gasto, calendario, utilización de crédito y cobertura de comercios. No hay comparación con una población real reservada, distancia distribucional calibrada, transferencia a datos reales ni evaluación ciega por expertos. No usar ledgers privados reduce el riesgo de exponer registros de clientes, pero no constituye privacidad diferencial, prueba contra ataques ni garantía de representatividad. Las reglas codifican supuestos estrechos: festivos de EE. UU., dólares, cinco salarios fijos cada catorce días, saldo inicial de 5.000, interés del 5% y lenguaje de amenaza de procesamiento penal.
El código público contradice además una pieza central del método descrito. El paper dice que comprueba postcondiciones antes de aceptar, rechaza planes inválidos y devuelve una corrección dirigida al LLM. En el release, update_history solo reintenta por JSON inválido, depósitos o timestamps mal formados; luego ejecuta las reglas y añade todas las transacciones. No hay verificador general, rollback ni re-prompt específico. El crédito puede quedar por debajo de cero y se inserta un aviso para el día siguiente; la simulación termina al tercer aviso. La probabilidad pública de eventos aleatorios es 0,3, no el 0,1 del manuscrito. Tampoco hay semillas para fechas, eventos, importes o muestreo del LLM, por lo que no es posible la regeneración exacta prometida.
La evaluación publicada no es un test final independiente. Solo se liberan train y test. Para iliquidez, VALI y TEST cargan el mismo test_df, de modo que early stopping selecciona el checkpoint con test. Para robo de identidad se calcula test loss en cada época y se elige sobre las propias etiquetas de test el umbral con mejor F1. Además, la codificación categórica se calcula tras concatenar train y test, y las ventanas de test se muestrean aleatoriamente sin semilla. El generador de fraude reemplaza un día legítimo por transacciones de un usuario sintético ilíquido, no añade un día, lo que puede introducir atajos propios de ese pool. Los resultados son exploratorios y probablemente optimistas. El release es grande y útil, código, 100.000 personas de entrada y aumentadas, ejemplos, datos raw y ocho parquets de tareas, pero carece de validación separada, logs completos, snapshots de estado, checks por evento, resultados, tests y CI. Sigue siendo un preprint arXiv v2 enviado a ICLR 2026; el registro público no aparece como aceptado.