El artículo estudia si una descripción de personalidad OCEAN cambia el orden en que un LLM elige tareas de una agenda diaria. A partir de 500 horarios laborales generados previamente por un LLM no identificado, cada actividad recibe un UID calculado con SHA-512 a partir del nombre y la hora asignada. En cada ciclo, el modelo ve primero una frase de personalidad, la hora actual, las tareas restantes en JSON, la lista de tareas completadas y la instrucción de devolver únicamente el UID siguiente. Debe completar todas las actividades y no puede omitir ninguna: la variable observada es, por tanto, una permutación de la misma lista, no una decisión abierta ni el desempeño de una acción en un entorno. Se prueban GPT-4o, GPT-4o-mini y GPT-3.5-Turbo con los cinco rasgos OCEAN en dirección alta y baja, más una condición sin personalidad. Los checkpoints exactos y gran parte de la configuración de API no se publican.
El análisis usa el desplazamiento de posición de cada tarea y cinco medidas normalizadas de comparación de secuencias: longest common substring, longest common prefix, distancia de Levenshtein, un ratio basado en longest common subsequence y distancia de Hamming. Para cada modelo se comparan las diez condiciones con el control mediante 50 t-tests de Welch independientes y corrección de Bonferroni hasta p≤0,001. Con temperatura 1,0, las 50 comparaciones de GPT-4o y las 50 de GPT-4o-mini se declaran significativas; para GPT-3.5-Turbo son 41 de 50. Sin embargo, la diferencia principal es que las condiciones con persona reordenan mucho más la agenda que el control. El propio artículo reconoce que en GPT-3.5 las diferencias absolutas son pequeñas pese a la significación. Al inspeccionar tareas concretas, GPT-4o con alta responsabilidad adelanta actividades de trabajo y con baja responsabilidad adelanta actividades personales; la alta extraversión adelanta tareas sociales y la baja extraversión favorece tareas solitarias. Ese análisis de plausibilidad se limita a responsabilidad y extraversión y utiliza categorías de tareas asignadas por los autores.
La evidencia no separa personalidad de seguimiento literal de instrucciones. Los prompts contienen descriptores transparentes como «outgoing, energetic, public» y las tareas tienen nombres semánticamente obvios como Work, Social Media o Team Collaboration. No hay control de igual longitud sin significado psicológico, ablación de los descriptores, evaluación humana ciega, inventario psicométrico ni prueba de que el patrón se mantenga fuera de esa lista. La significación frente a un control no demuestra que el cambio sea coherente con un rasgo; para apertura, amabilidad y neuroticismo el artículo ofrece sobre todo magnitud de reordenación. Además, los mismos 500 horarios parecen reutilizarse entre condiciones, pero se aplican pruebas independientes en vez de un análisis emparejado o de medidas repetidas. Cada prompt se ejecuta una sola vez por horario y condición, por lo que no se estima la estabilidad ante la no determinación que el propio trabajo invoca.
La auditoría detecta una inconsistencia sustancial en el ratio SR. El método lo define como Similarity Ratio derivado de LCS y afirma que 1 representa alineación perfecta. No obstante, en la Tabla 1 SR aumenta con la temperatura, de 0,321 a 0,446 para GPT-4o y de 0,393 a 0,530 para GPT-4o-mini, mientras el texto sostiene que disminuye. En la Tabla 2, el control obtiene SR de 0,35/0,45 y las condiciones con personalidad valores de 0,57 a 0,94, patrón opuesto al de LCSS y LCP y más compatible con una distancia. La narración también cita valores de temperatura cero que no coinciden con la tabla: informa 0,652/0,615 para GPT-4o y 0,528/0,489 para GPT-4o-mini, frente a 0,635/0,604 y 0,522/0,476 impresos. Estas contradicciones impiden interpretar SR como validación adicional y reducen la confianza en la lectura de temperatura.
La relación con SANDMAN y la ciberdefensa es prospectiva. No se prueba un honeypot, un adversario, el realismo para observadores, la retención de atacantes, la seguridad ni una decisión con consecuencias. La sección ética reconoce riesgos de desinformación y persuasión y propone supervisión, mitigación de sesgos y alineación de forma general, pero no implementa controles y basa el uso defensivo en la idea de «rightful deception». No se enlazan código, horarios, prompts completos, resultados o datos, y una búsqueda dirigida no localizó un repositorio oficial. La contribución defendible es un procedimiento para cuantificar cuánto reordena un LLM una lista cerrada bajo descripciones OCEAN y una demostración exploratoria de asociaciones semánticas previsibles en GPT-4o; no evidencia personalidad psicológica, autonomía operativa ni eficacia de ciberdefensa.