Este trabajo analiza cómo la información de persona modifica conversaciones de apoyo emocional sintetizadas por LLM. El pipeline usa GPT-4o mini para extraer edad, género, ocupación, descripción sociodemográfica y problema emocional de ESConv, CAMS y Dreaddit; después GPT-4o mini, Claude 3.5 Haiku y Llama 3.1 8B amplían las tarjetas con descripciones alineadas a HEXACO y al Communication Styles Inventory, responden ambos cuestionarios y correlacionan sus seis dimensiones. En un segundo experimento, 1.000 descripciones de PersonaHub se enriquecen con datos y frases indicativas de rasgos, se puntúan, se usan para generar diálogos buscador-soporte, se vuelven a extraer y se puntúan de nuevo. Las distribuciones agregadas permanecen parecidas en Honesty-Humility, Agreeableness, Conscientiousness y Openness, pero las personas derivadas del diálogo muestran mayor Emotionality y menor Extraversion. Finalmente, se continúan historias ESConv con y sin las doce puntuaciones HEXACO/CSI del buscador. Con persona, GPT-4o mini y Claude generan más preguntas y affirmation/reassurance y menos self-disclosure; Llama cambia menos. Diez estudiantes anglófonos comparan 50 pares: la versión con persona gana 37–39 % y pierde 33–35 % en suggestion, comforting, identification y overall, mientras consistency empata en 54 %. La aportación defendible es que añadir información explícita de persona cambia de forma medible el texto, la longitud y las estrategias autoetiquetadas del diálogo sintético, y ofrece una señal humana débil pero favorable. Sin embargo, no valida rasgos psicológicos estables ni una mejora terapéutica. El mismo LLM redacta descripciones de rasgo, contesta los dos inventarios, genera ambos interlocutores, vuelve a extraer la persona y etiqueta sus propias estrategias; esto introduce circularidad y common-method bias. La supuesta estabilidad se apoya en violin plots de distribuciones, no en retención persona-a-persona: una distribución puede coincidir aunque todos los individuos hayan cambiado. El control sin persona tampoco iguala información o longitud, y el modelo omnisciente cambia tanto al buscador como al soporte. La evaluación humana no publica intervalos, tests, acuerdo, cegamiento ni ratings crudos, por lo que márgenes de 3–5 puntos no demuestran superioridad. Además, la distribución GPT-4o mini con persona suma 101,10 %, imposible por redondeo, y el texto habla de diferencias significativas sin reportar tests. No hay código, datos generados ni juicios enlazados públicamente. El checklist reconoce que no se comprobaron PII/contenido ofensivo ni se documentaron los artefactos, pese a derivar tarjetas personales detalladas de datos sensibles de salud mental. La conclusión fiel es que las personas son una variable de diseño influyente para síntesis de conversaciones; aún no hay evidencia suficiente de inferencia psicométrica válida, eficacia, seguridad, privacidad o preparación para despliegue real.
Pregunta de investigación
¿Pueden los LLM inferir rasgos HEXACO y estilos comunicativos coherentes desde tarjetas de persona, conservar esos rasgos al sintetizar conversaciones de apoyo emocional y modificar mediante su inyección las estrategias y la calidad percibida de esos diálogos?