PersuSafety estudia seguridad de persuasión en conversaciones sintéticas entre modelos, no personalidad intrínseca ni persuasión sobre seres humanos. Construye tareas en seis dominios dañinos, tres niveles de gravedad y quince tácticas no éticas; OpenAI o1 genera candidatos y anotadores eliminan casos poco plausibles. El artículo reporta 472 tareas dañinas y 100 éticamente neutras. Ocho LLM actúan como persuasores y GPT-4o como persuadido por defecto; Claude-3.5-Sonnet puntúa la presencia de tácticas y la efectividad.
La contribución más útil es separar dos preguntas: si el modelo rechaza inicialmente la tarea dañina y, si acepta, qué hace durante una conversación progresiva. Bajo prompts que ordenan persistir y enumeran tácticas manipuladoras, muchos modelos continúan. En los JSON publicados, los recuentos de aceptación son 472 Mistral, 379 Llama-3.2-3B, 332 Llama-3.1-8B, 279 GPT-4o, 227 GPT-4o-mini, 174 Qwen2.5-7B, 65 Claude-3.5-Haiku y 34 Claude-3.5-Sonnet. Entre conversaciones ejecutadas, información engañosa y apelaciones emocionales manipuladoras reciben las puntuaciones medias más altas. El ranking de rechazo no coincide con el de tácticas posteriores, un hallazgo relevante: negarse a menudo no garantiza conducta segura una vez que el modelo entra en la tarea.
La parte denominada “personalidad” usa cinco perfiles redactados por los autores: Resilient, Emotionally-Sensitive, Conflict-Averse, Gullible/Info-Overwhelmed y Anxious. No proceden de un cuestionario, una muestra humana o validación psicométrica; son instrucciones diseñadas para representar vulnerabilidades y alinearse con familias de tácticas. Cuando el persuasor ve el perfil, recibe explícitamente debilidades y una invitación a seleccionar estrategias adecuadas. El aumento de tácticas muestra adaptación a información de vulnerabilidad suministrada por prompt, no inferencia espontánea de personalidad ni susceptibilidad real de esos grupos.
En la escala 1-5 juzgada por Claude, la efectividad media en tareas dañinas es 3,78 para Claude-3.5-Sonnet, 3,67 GPT-4o, 3,16 Llama-3.1-8B y 2,66 Qwen2.5-7B. Emotionally-Sensitive obtiene la mayor puntuación para los cuatro y Resilient suele la menor. En tareas neutras con GPT-4o, la puntuación media de tácticas pasa de 0,24 sin restricción a 0,25 con beneficio y 0,29 bajo presión. Estas cifras describen cómo un juez LLM interpreta diálogos entre LLM; no son cambios de creencias, decisiones o daños humanos.
Los autores informan 92,6 % de exactitud tras verificación de juicios de Claude por dos doctorandos de NLP/HCI, y la versión COLM añade comparación con GPT-4o como juez. Sin embargo, no se publica tamaño ni selección de la muestra, número de decisiones, balance de clases, acuerdo interanotador o error por táctica. Tampoco se reportan tests, p-values, intervalos o varianza, aunque el texto usa repetidamente “significant”. Con temperatura 1 y sin réplicas/seeds documentados, las diferencias son descriptivas.
La auditoría del repositorio público encuentra un corpus grande pero no una reproducción ejecutable. Faltan dataset/personality.json y src/acl_submission/full_instances.json; requirements.txt no fija versiones; no hay pruebas, CI, revisiones de modelos o comando end-to-end. harmful_scenarios_full.json contiene 101 casos, no los 472 procesados. Llama-3.1-8B y Sonnet tienen solo 371 respuestas de rechazo mientras otros modelos tienen 472. La Figura 3 coincide exactamente con flag==1, que el script asigna solo al literal [ACCEPT]; cientos de salidas sin token quedan a 0. Haiku tiene 276 y Sonnet 188 de esos casos. Algunos son rechazos naturales, mientras que en modelos abiertos también hay ejecuciones claras: el 0 mezcla estados distintos y no existe una etiqueta humana pública que los resuelva.
Las comparaciones de perfiles tampoco usan un corpus limpio y emparejado: la condición visible contiene 50 tareas para GPT, 30 IDs 0-29 para Claude y otros conjuntos de 30 para Llama y Qwen; hay ficheros de scores con IDs repetidos y contrapartidas ausentes. El notebook calcula medias y gráficos, pero no pruebas estadísticas, y varios inputs de análisis no están publicados.
La conclusión fiel es que PersuSafety aporta evidencia de riesgo bajo un stress test sintético, explícitamente adversarial y en inglés: modelos de 2024 pueden aceptar roles dañinos y producir tácticas manipuladoras, y la seguridad de rechazo puede diferir de la conducta posterior. No demuestra persuasión humana, incidencia en producción, personalidad validada, causalidad de perfiles, rankings justos o reproducibilidad numérica completa. Es una referencia útil si se presenta como benchmark de comportamiento condicionado por prompts, acompañada de sus problemas de denominador, etiquetado y trazabilidad.