Este trabajo intenta inferir rasgos humanos, no personalidad de la máquina. Personas reclutadas en Amazon Mechanical Turk completaron BFI-44, IOS, KISS-18 y ATQ y mantuvieron tres conversaciones con uno de tres sistemas: un pipeline orientado a tareas, SimpleTOD orientado a tareas o BlenderBot abierto. Tras filtros quedaron 179, 199 y 186 participantes, respectivamente. BERT-base-uncased recibe solo los mensajes del usuario y aprende por separado 25 objetivos.
“Predecir personalidad” significa aquí clasificar si una puntuación está por encima o por debajo de la mediana de training+validation. No se predice el valor continuo ni un nivel normativo. Además, la regla publicada deja sin definir los empates exactamente en la mediana, relevantes porque los cuestionarios producen puntuaciones discretas. El umbral cambia entre particiones, por lo que una balanced accuracy de 0,64 describe una etiqueta relativa y móvil, no una evaluación individual estable.
Los mejores resultados aparecen en diálogo abierto: 0,71 para Conscientiousness, 0,68 Agreeableness, 0,60 Neuroticism, 0,61 IOS y 0,60-0,68 para cinco facetas de temperamento/sociales. Extraversion llega a 0,64 tanto en diálogo abierto como en el pipeline de tareas. Muchas de las 25 variables se mantienen cerca del baseline de 0,50. El único comparador es un clasificador mayoritario cuya balanced accuracy es 0,50 por construcción; faltan baselines de longitud, vocabulario, TF-IDF o modelos lineales que indiquen cuánto añade BERT.
No puede atribuirse causalmente la ventaja al diálogo abierto. Cada condición usa personas distintas y no se informa asignación aleatoria ni demografía por cohorte. Cambian simultáneamente dominio, arquitectura, dificultad, límite de turnos, contenido, persona del sistema, calidad y tasa de éxito. El diálogo abierto también contiene más vocabulario del usuario (90,2 términos por diálogo frente a 70,8 y 58,1) y mayor diversidad léxica. La comparación mide paquetes completos y distribuciones diferentes.
La transferencia entre dominios suele acercarse al azar, un hallazgo útil sobre distribution shift. Pero solo se prueba este BERT y estos tres corpus históricos, sin adaptación de dominio; no demuestra que datos abiertos nunca puedan ayudar en tareas. Tampoco se demuestra que una ronda sea “suficiente” o que el éxito de la tarea sea irrelevante: esas conclusiones se basan en pocas diferencias significativas, sin equivalence tests o potencia. La explicación de que SimpleTOD limita la libre expresión se apoya en tasa de éxito y scatterplots, no en una prueba causal.
La inferencia estadística no es reproducible: el artículo dice “non-parametric t-test”, una denominación contradictoria, y compara estimaciones de cross-validation solapadas. No se identifica el test ni su estadístico. También faltan scoring, reverse coding, fiabilidad y distribuciones de los cuestionarios. Los datos y el código se ofrecen solo “upon reasonable request”; no se localizó release público en Nature, PMC, la página del autor o su GitHub.
La conclusión fiel es modesta: en estas muestras AMT y sistemas de 2023, algunos grupos relativos de rasgos dejan señales textuales recuperables por BERT, sobre todo cuando la conversación es abierta. No se validan puntuaciones continuas, utilidad operativa, fairness, beneficio de personalización ni generalización a LLM actuales. Una tasa de 0,60-0,71 implica errores sustanciales y el estudio no despliega decisiones adaptativas para comprobar si ayudan o dañan.