El trabajo explora si agentes obtenidos como muestras estocásticas de GPT-3.5-turbo-0613 mantienen una persona durante una tarea de escritura y si su lenguaje se aproxima al de otro agente. Los autores crean dos prompts extremos. La persona denominada creative es extrovertida, agradable, responsable, neurótica y abierta; la denominada analytical es introvertida, antagonista, poco responsable, emocionalmente estable y cerrada. Los cinco rasgos cambian a la vez y los nombres creative/analytical son etiquetas operativas, no perfiles humanos validados. Cada salida a temperatura 0,7 se trata como un agente distinto. Antes y después de escribir una historia personal, la misma instancia responde los 44 ítems del Big Five Inventory; las historias de 500 a 900 palabras se convierten en recuentos de 62 categorías LIWC 2007. La condición interactiva es un único intercambio unidireccional: un agente escribe primero y el segundo recibe íntegramente esa historia dentro de su prompt para producir otra.
En la condición sin interacción, los perfiles quedan muy separados en cuatro rasgos BFI; neuroticismo se solapa más. El grupo creative conserva prácticamente sus medias después de escribir: 35 en extraversión, 41 en amabilidad, 37 en responsabilidad, 16 en neuroticismo y 47 en apertura. El grupo analytical se desplaza después de la historia desde 15/11/18/13/15 hasta 17/21/32/15/29. Con recuentos LIWC, una regresión logística con validación cruzada de diez pliegues alcanza 98,5 % de exactitud para distinguir las dos etiquetas. Las asociaciones principales presentan más emoción positiva e inclusión en creative y más discrepancia, emoción negativa e insight en analytical. Sin embargo, estos cinco rasgos están manipulados en bloque y casi perfectamente correlacionados con el grupo, por lo que no puede atribuirse cada patrón a un rasgo individual.
Después de la escritura colaborativa, la exactitud del clasificador baja a 66,15 % y las correlaciones entre BFI y LIWC se acercan a cero. El artículo interpreta esa convergencia como alineación lingüística y afirma que creative se adapta más a analytical. Las respuestas BFI de creative siguen estables; las de analytical quedan entre el punto inicial y la condición de escritura individual: amabilidad 18, responsabilidad 26, neuroticismo 17 y apertura 22. Los autores interpretan este último patrón como inconsistencia de analytical, no como alineación explícita con la pareja. Es una distinción razonable dentro de sus resultados, pero el diseño no mide alineación dentro de cada pareja ni permite separar adaptación, copia del texto recibido, memoria conversacional o simple cambio de tema.
La auditoría del repositorio oficial, congelado en el commit ca6e117eb5a904fa97115f8845ef8b74aa461b8a, encuentra 65 salidas por etiqueta y condición. Los datos fortalecen varias cautelas que el PDF solo menciona de forma cualitativa. Aunque el prompt ordena no mencionar rasgos, los 130 relatos de control contienen al menos un término explícito de la persona según una comprobación dirigida; ocurre en 130/130 historias de ANACREA, 124/130 de CREAANA y 124/130 de CREACREA. Por ello, el 98,5 % puede reflejar palabras como extrovert, introvert, antagonistic o conscientious, no una expresión implícita de personalidad. Además, 37 de 65 parejas ANACREA, 15 de 65 CREAANA y 47 de 65 CREACREA contienen historias exactamente idénticas entre los dos agentes. La caída del clasificador puede proceder en parte de reproducción literal del relato insertado en el prompt. Los recuentos LIWC no se normalizan por longitud y la validación cruzada no agrupa parejas, de modo que observaciones relacionadas pueden repartirse entre entrenamiento y prueba.
La implementación mantiene en memoria el primer BFI, la historia y el segundo BFI de cada instancia. Así, estabilidad o cambio posterior puede ser retención contextual de respuestas previas, no persistencia de una personalidad fuera del historial. Los análisis antes/después usan f_oneway y d de Cohen para muestras independientes, aunque son mediciones emparejadas del mismo agente; no se corrige la extensa exploración de categorías LIWC y correlaciones. El PDF declara el snapshot gpt-3.5-turbo-0613, pero el código llama al alias mutable gpt-3.5-turbo; el snapshot declarado fue retirado del API el 13 de septiembre de 2024, por lo que hoy no puede repetirse literalmente. El repositorio aporta código, datos y licencia MIT, pero no lockfile, semillas, historial de reintentos ni una configuración que regenere automáticamente n=65. La contribución defendible es evidencia exploratoria de que dos prompts Big Five extremos producen distribuciones de BFI y vocabulario distintas, y de que exponer un segundo modelo a una historia completa reduce esa separabilidad. No prueba personalidad humana, consistencia psicométrica, adaptación conversacional bidireccional ni simulación válida de poblaciones humanas.