Este trabajo de Findings of EMNLP 2023 estudia la personalidad percibida de BERT-base y GPT-2 de 124M mediante una adaptación del cuestionario IPIP Big Five de 50 ítems. Convierte las respuestas de acuerdo/desacuerdo en los adverbios never, rarely, sometimes, often y always y transforma cada ítem en una frase para completar. BERT selecciona el token enmascarado más probable y GPT-2 la oración completa más probable. Las puntuaciones deterministas se mapean a percentiles de una base externa de 1.015.000 cuestionarios humanos. Que los diez resultados base estén a menos de 26 puntos del percentil mediano no demuestra que el preentrenamiento reproduzca una población: el paper no publica los márgenes del TOST ni justifica tratar una salida de modelo como observación comparable a una persona. El experimento central antepone a cada ítem uno de diez enunciados del mismo rasgo combinado con cinco intensidades. Esto produce 500 respuestas y 50 puntuaciones por rasgo y modelo. La dirección esperada r_cm se deriva de la misma clave de puntuación y de la intensidad lexical, y se correlaciona con el cambio observado. Las correlaciones globales son 0,40 para BERT y 0,54 para GPT-2; la mediana de las cincuenta correlaciones por ítem, cada una calculada con solo cinco puntos, es 0,84 y 0,81. Sin embargo, cada enunciado se usa también como contexto de sí mismo, lo que permite copiar el modificador. Al reemplazar esa respuesta por el baseline, las medias bajan a 0,25 y 0,40. Los dobles negativos producen acumulaciones cerca de −1 y una prueba alternativa excluye neutral y solo reporta seis de diez combinaciones rasgo-modelo. Por tanto, el resultado sólido es sensibilidad predecible a cuantificadores y contenido lexical, no control validado de personalidad. Un análisis exploratorio usa 1.119 descripciones de Reddit como contexto. Regresiones bag-of-words y n-gram se ajustan solo a casos con cambio absoluto ≥1 y se interpretan mediante pesos extremos; no se reportan particiones de validación ni capacidad predictiva y aparecen asociaciones ruidosas o espurias. Un estudio IRB con Mechanical Turk conserva 404 personas: 199 reciben definiciones de los Big Five antes de escribir y 205 no; alrededor de una cuarta parte incumple el mínimo de 75 palabras. Tras filtrar outliers o longitud, la correlación entre puntuaciones humanas y las obtenidas al usar su autodescripción como contexto llega a 0,44 para BERT y 0,48 para GPT-2 en respuestas dirigidas; en no dirigidas es 0,40 y 0,48 sin outliers. No se ofrecen intervalos, p-valores, muestra residual por filtro, validación externa ni comparación con clasificadores de texto. Esto aporta evidencia moderada de que una descripción explícita contiene señales asociadas al autoinforme de su autor, no de que el modelo adopte esa personalidad o pueda sustituir la evaluación humana. Finalmente, GPT-2 genera 50 tokens desde 1.500 combinaciones aproximadas de un enunciado de rasgo y seis prompts neutros. El texto generado se vuelve a introducir en el mismo GPT-2 como contexto del cuestionario y su puntuación correlaciona 0,49 con la del enunciado inicial. El diseño es circular y carece de jueces humanos: puede reflejar continuación lexical, no personalidad percibida por usuarios. El paper aporta un antecedente útil de priming contextual y dos conjuntos de descripciones, pero no establece rasgos internos, persistencia, transferencia conductual, robustez en modelos modernos ni seguridad clínica. La auditoría del repositorio enlazado en el PDF, en el commit 3388f194a6410162e4c2a614e12846f02cf5a939, confirma los dos CSV con exactamente 199 y 205 filas válidas, pero no encuentra código pese a que el README anuncia «dataset and code». El supuesto `reddit-data.json` contiene 1.119 cadenas, pero no puede parsearse como JSON porque está delimitado por llaves en vez de corchetes. Tampoco hay licencia, resultados derivados, parámetros de ejecución ni scripts para regenerar tablas y figuras. Los datos humanos son parcialmente comprobables; los experimentos completos no son reproducibles desde el artefacto publicado.
Pregunta de investigación
¿Pueden las puntuaciones Big Five obtenidas de BERT y GPT-2 modificarse de forma predecible con distintos contextos, reflejar señales de personalidad en autodescripciones humanas y trasladarse al texto generado?