Personality prediction from task-oriented and open-domain human–machine dialogues

Personas, identidad y agentes2024Scientific ReportsRevisión editorial aprobada

Título original: Personality prediction from task-oriented and open-domain human-machine dialogues

Autores: Ao Guo, Ryu Hirai, Atsumoto Ohashi, Yuya Chiba, Yuiko Tsunomori, Ryuichiro Higashinaka

Palabras clave: Personality Prediction, Human-Machine Dialogue, Big Five, BFI-44, KISS-18, Adult Temperament Questionnaire, BERT, Balanced Accuracy, Domain Shift, Psychometric Validity, Reproducibility

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
12
Hallazgos
21
Limitaciones
9
Evidencias

Resumen editorial

Español

Este trabajo intenta inferir rasgos humanos, no personalidad de la máquina. Personas reclutadas en Amazon Mechanical Turk completaron BFI-44, IOS, KISS-18 y ATQ y mantuvieron tres conversaciones con uno de tres sistemas: un pipeline orientado a tareas, SimpleTOD orientado a tareas o BlenderBot abierto. Tras filtros quedaron 179, 199 y 186 participantes, respectivamente. BERT-base-uncased recibe solo los mensajes del usuario y aprende por separado 25 objetivos.

“Predecir personalidad” significa aquí clasificar si una puntuación está por encima o por debajo de la mediana de training+validation. No se predice el valor continuo ni un nivel normativo. Además, la regla publicada deja sin definir los empates exactamente en la mediana, relevantes porque los cuestionarios producen puntuaciones discretas. El umbral cambia entre particiones, por lo que una balanced accuracy de 0,64 describe una etiqueta relativa y móvil, no una evaluación individual estable.

Los mejores resultados aparecen en diálogo abierto: 0,71 para Conscientiousness, 0,68 Agreeableness, 0,60 Neuroticism, 0,61 IOS y 0,60-0,68 para cinco facetas de temperamento/sociales. Extraversion llega a 0,64 tanto en diálogo abierto como en el pipeline de tareas. Muchas de las 25 variables se mantienen cerca del baseline de 0,50. El único comparador es un clasificador mayoritario cuya balanced accuracy es 0,50 por construcción; faltan baselines de longitud, vocabulario, TF-IDF o modelos lineales que indiquen cuánto añade BERT.

No puede atribuirse causalmente la ventaja al diálogo abierto. Cada condición usa personas distintas y no se informa asignación aleatoria ni demografía por cohorte. Cambian simultáneamente dominio, arquitectura, dificultad, límite de turnos, contenido, persona del sistema, calidad y tasa de éxito. El diálogo abierto también contiene más vocabulario del usuario (90,2 términos por diálogo frente a 70,8 y 58,1) y mayor diversidad léxica. La comparación mide paquetes completos y distribuciones diferentes.

La transferencia entre dominios suele acercarse al azar, un hallazgo útil sobre distribution shift. Pero solo se prueba este BERT y estos tres corpus históricos, sin adaptación de dominio; no demuestra que datos abiertos nunca puedan ayudar en tareas. Tampoco se demuestra que una ronda sea “suficiente” o que el éxito de la tarea sea irrelevante: esas conclusiones se basan en pocas diferencias significativas, sin equivalence tests o potencia. La explicación de que SimpleTOD limita la libre expresión se apoya en tasa de éxito y scatterplots, no en una prueba causal.

La inferencia estadística no es reproducible: el artículo dice “non-parametric t-test”, una denominación contradictoria, y compara estimaciones de cross-validation solapadas. No se identifica el test ni su estadístico. También faltan scoring, reverse coding, fiabilidad y distribuciones de los cuestionarios. Los datos y el código se ofrecen solo “upon reasonable request”; no se localizó release público en Nature, PMC, la página del autor o su GitHub.

La conclusión fiel es modesta: en estas muestras AMT y sistemas de 2023, algunos grupos relativos de rasgos dejan señales textuales recuperables por BERT, sobre todo cuando la conversación es abierta. No se validan puntuaciones continuas, utilidad operativa, fairness, beneficio de personalización ni generalización a LLM actuales. Una tasa de 0,60-0,71 implica errores sustanciales y el estudio no despliega decisiones adaptativas para comprobar si ayudan o dañan.

English

This work attempts to infer human traits, not machine personality. Amazon Mechanical Turk participants completed BFI-44, IOS, KISS-18 and ATQ measures and held three conversations with one of three systems: a pipeline task system, task-oriented SimpleTOD or open-domain BlenderBot. After filtering, 179, 199 and 186 participants remained. BERT-base-uncased receives only user messages and learns 25 separate targets.

“Personality prediction” here means classifying whether a score is above or below the training-plus-validation median. It does not estimate a continuous score or normative level. The published rule also leaves exact median ties undefined, important because questionnaire totals are discrete. Thresholds change across splits, so .64 balanced accuracy describes a relative, moving label rather than a stable individual assessment.

The strongest results occur in open-domain dialogue: .71 Conscientiousness, .68 Agreeableness, .60 Neuroticism, .61 IOS and .60-.68 for five temperament/social facets. Extraversion reaches .64 in both open-domain and pipeline task dialogue. Many of the 25 outcomes remain near the .50 baseline. The only comparator is a majority classifier whose balanced accuracy is .50 by construction; length, vocabulary, TF-IDF and linear baselines are absent, so BERT's added value is unknown.

The open-domain advantage is not causal. Each condition uses different people, with no reported random assignment or cohort demographics. Domain, architecture, difficulty, turn limit, content, system persona, quality and success rate change together. Open-domain dialogue also contains more user vocabulary (90.2 terms per dialogue versus 70.8 and 58.1) and higher lexical diversity. The comparison is between complete packages and populations.

Cross-domain performance is often near chance, useful evidence of distribution shift. But only this BERT and three historical corpora are tested without domain adaptation; the study cannot show that open-domain data can never aid task prediction. Nor does it establish that one round is sufficient or task success irrelevant: these are absence-of-significance claims without equivalence tests or power. The proposed SimpleTOD free-expression mechanism rests on success rates and scatterplots, not causal analysis.

Statistical inference is not reproducible: the article names a “non-parametric t-test”, a contradictory label, and compares overlapping cross-validation estimates without identifying the test statistic. Questionnaire scoring, reverse coding, reliability and distributions are also omitted. Data and code are available only “upon reasonable request”; no public release was found through Nature, PMC, the author page or author GitHub.

The faithful conclusion is modest: in these AMT samples and historical systems, some relative trait groups leave textual signals recoverable by BERT, especially in unconstrained dialogue. Continuous validity, operational utility, fairness, personalization benefit and generalization to current LLMs are not validated. Balanced accuracy of .60-.71 still implies substantial error, and the study never deploys adaptive decisions to test benefit or harm.

Pregunta de investigación

¿Con qué balanced accuracy puede BERT separar puntuaciones de 25 rasgos humanos por encima o debajo de la mediana usando mensajes en diálogos máquina-humano orientados a tarea o abiertos, y cuánto transfieren los modelos entre esos dominios?

Método

Estudio AMT con cuatro cuestionarios y tres rondas por participante en una sola condición: ConvLab-2 pipeline, SimpleTOD E2E o BlenderBot 400M abierto. Tras filtros quedan 179/199/186 personas. Cada rasgo se dicotomiza por la mediana de training+validation. BERT-base-uncased clasifica texto del usuario en validación cruzada 10-fold repetida diez veces; se usa balanced accuracy y un baseline mayoritario. Diez rasgos con al menos 0,60 entran en comparación cross-domain 8:1:1 promediada sobre 100 seeds. Longformer, rondas y éxito/fallo se analizan adicionalmente.

Muestra: 610 participantes AMT inicialmente: 204 pipeline, 205 E2E y 201 open-domain. Tras excluir por completar tres rondas en menos de cinco minutos o tener alguna ronda con menos de diez palabras únicas, quedan 179, 199 y 186 (564 total). Regiones limitadas a países anglófonos, más de 100 HIT y approval >95 %, pago USD10. No se reportan edad, género, país, educación ni balance demográfico entre condiciones.

Hallazgos

  • El diálogo abierto obtiene balanced accuracy 0,71 Conscientiousness, 0,68 Agreeableness, 0,60 Neuroticism y 0,61 IOS.
  • En abierto también se reporta 0,64 Frustration, 0,60 Activation Control, 0,65 Attentional Control, 0,62 Sociability y 0,68 Neutral Perceptual Sensitivity.
  • Extraversion alcanza 0,64 tanto en abierto como en pipeline orientado a tarea.
  • La mayoría de los demás rasgos permanece cerca de 0,50-0,60.
  • Open-domain tiene vocabulario del usuario 90,2 y diversidad 0,42 frente a 70,8/0,30 pipeline y 58,1/0,35 E2E.
  • La tasa de éxito es 47 % pipeline y 28 % E2E.
  • Transfer O→P queda cerca del azar: 0,52 C, 0,52 E, 0,51 A, 0,50 N y 0,56 IOS.
  • Transfer P→O da 0,57 C, 0,62 E, 0,54 A, 0,49 N y 0,57 IOS: débil, pero no siempre igual al azar.
  • Añadir texto del sistema suele reducir el rendimiento de Longformer.
  • Se detectan pocas diferencias entre rondas y entre diálogos exitosos/fallidos, sin demostrar equivalencia.
  • El artículo reconoce que 0,60 no es alto y que errores pueden reducir satisfacción.
  • El código y los datos son request-only; no se localizó release público.

Limitaciones

  • Los rasgos continuos se reducen a categorías relativas alto/bajo y se pierde magnitud.
  • El umbral cambia por split y no define qué ocurre con valores iguales a la mediana.
  • Cada condición usa cohortes distintas sin asignación aleatoria ni demografía reportada.
  • Dominio, arquitectura, tarea, dificultad, longitud, persona, calidad y éxito cambian a la vez.
  • El diálogo abierto ofrece más texto y diversidad, un confusor directo de la predicción.
  • El único baseline es mayoritario con balanced accuracy 0,50 por construcción.
  • No hay baselines lexicales, lineales, TF-IDF o de longitud/vocabulario.
  • El filtro elimina participantes por poco vocabulario, señal que luego usa el predictor.
  • No se reporta scoring, reverse coding, fiabilidad, missingness o distribuciones de los cuestionarios.
  • IOS y habilidades sociales no son equivalentes a rasgos amplios de personalidad.
  • La expresión 'non-parametric t-test' no identifica un procedimiento estadístico válido.
  • Las repeticiones de cross-validation comparten datos y no son observaciones independientes.
  • No se muestran intervalos de generalización por participante ni calibración.
  • La comparación cross-domain selecciona post hoc diez rasgos con al menos 0,60.
  • No se prueba domain adaptation ni un corpus externo.
  • Ausencia de diferencias significativas no demuestra suficiencia o irrelevancia.
  • La explicación causal de SimpleTOD se basa en descriptivos.
  • No hay evaluación de fairness, privacidad, consentimiento para profiling o error por subgrupo.
  • La utilidad para adaptación no se prueba en un sistema desplegado.
  • Código, datos, splits, seeds, versiones y checkpoints no son públicos.
  • Los sistemas de diálogo son históricos y no representan LLM actuales.

Qué no demuestra

  • No predice puntuaciones continuas o niveles clínicos/normativos de personalidad.
  • No demuestra que el diálogo abierto cause mejor inferencia.
  • No demuestra que 0,60-0,71 sea suficiente para personalización.
  • No prueba beneficio en satisfacción, confianza o éxito de tarea.
  • No demuestra equivalencia entre una y tres rondas.
  • No demuestra que el éxito de tarea sea irrelevante.
  • No demuestra que SimpleTOD cause menor libre expresión.
  • No demuestra imposibilidad universal de transferencia entre dominios.
  • No demuestra que BERT supere baselines lexicales simples.
  • No demuestra fiabilidad y equivalencia de los labels entre cohortes.
  • No demuestra fairness entre grupos.
  • No permite reproducir cifras con artefactos públicos.
  • No generaliza automáticamente a LLM actuales, voz o poblaciones no AMT.
  • No estudia ni demuestra personalidad de la IA.

Trazabilidad

Alcance: Texto completo

Versión: Scientific Reports 14:3868 version of record, published online 16 February 2024

Fuente consultada: https://www.nature.com/articles/s41598-024-53989-y

Revisión: Codex full-text, visual, psychometric, statistical and artifact audit, 2026-07-16

Aprobación: Codex fidelity pass, 2026-07-16

Modelos evaluados

  • BERT-base-uncased personality classifiers
  • Longformer-base-4096 user/system-text analysis
  • ConvLab-2 pipeline task-oriented dialogue system
  • GPT-2-based SimpleTOD end-to-end task-oriented dialogue system
  • Distilled BlenderBot 400M open-domain dialogue system

Instrumentos y métricas

  • Big Five Inventory 44 (BFI-44)
  • Inclusion of Other in the Self (IOS) Scale
  • Kikuchi's Scale of Social Skills (KISS-18)
  • Adult Temperament Questionnaire (ATQ)
  • Above/below training-validation median labels
  • Balanced accuracy
  • Repeated participant-level 10-fold cross-validation

Datos utilizados

  • 537 retained pipeline task dialogues from 179 participants (request-only)
  • 597 retained SimpleTOD task dialogues from 199 participants (request-only)
  • 558 retained BlenderBot open-domain dialogues from 186 participants (request-only)
  • MultiWOZ 2.1 task goals
  • Four-questionnaire participant trait labels (request-only)

Evidencia y localización

  • Constructos, dicotomización, modelo, métrica y baseline: Version of record pp. 3-4, Approach, Personality labeling, BERT-based model and Evaluation metric
  • Reclutamiento, sistemas, filtros y estadísticas: Version of record pp. 4-6, Data collection and Tables 1-2
  • Configuración, repeated CV y resultados principales: Version of record pp. 6-7, Experiments and Figure 2
  • Transferencia entre dominios: Version of record pp. 7-8, Table 3 and cross-comparison section
  • Texto del sistema, rondas, éxito y mecanismo E2E: Version of record pp. 8-11, Figures 3-6 and Analyses
  • Cautelas y recomendación operativa: Version of record pp. 10-11, Conclusion and future work
  • Disponibilidad request-only: Version of record p. 11, Data availability
  • Ausencia de release público: Nature, PMC, author site and GitHub guoao8644 title/DOI searches audited 16 Jul 2026
  • Informe completo: reports/verification/article-212-dialogue-personality-prediction-validity-and-artifact-audit.json