Este trabajo pregunta si añadir los rasgos Big Five de una persona a mensajes de actividad física generados por un LLM mejora cada mensaje o si se asocia con una valoración global más favorable cuando una persona ve una proporción mayor de mensajes personalizados. Esta revisión usa el manuscrito completo arXiv:2602.06596v2, revisado el 27 de febrero de 2026, de 53 páginas. El documento sigue “currently under review”, conserva los CCS y la referencia de plantilla ACM sin completar y sustituye los enlaces de datos, código e IRB por [BLIND_FOR_REVIEW]. No se encontró publicación definitiva ni repositorio oficial público, por lo que los datos, el código, los modelos fine-tuned y el análisis no pueden reproducirse.
El estudio tiene dos fases. Primero, 210 participantes sedentarios reclutados en Prolific evaluaron cinco de quince situaciones hipotéticas y aportaron feedback; ese material alimentó ejemplos few-shot, recuperación RAG y fine-tuning. Después, una muestra final declarada de 90 personas recordó cinco momentos de la semana anterior, describió veinte variables contextuales y valoró mensajes que hipotéticamente habría recibido. Para cada contexto se ejecutaron ocho configuraciones de ChatGPT-4o: baseline, few-shot con self-consistency, RAG y fine-tuning, cada una con y sin las puntuaciones BFI-10. Las ocho salidas se mostraron mediante pestañas en orden aleatorio. El LLM decidía primero si enviar; de 3.600 decisiones, produjo 2.345 mensajes y retuvo 1.255. Esto no fue una intervención JITAI en la vida diaria: no hubo entrega en tiempo real, seguimiento de conducta, relación longitudinal ni outcome de actividad física.
La manipulación tampoco equivale a “alineación de personalidad” validada. La condición BFPT simplemente entrega al mismo modelo cinco puntuaciones de 1 a 5 y le pide adaptar tono y fraseo; no se comprueba mediante jueces humanos o análisis lingüístico que los mensajes expresen los rasgos correctamente, que resulten congruentes para la persona o que difieran de forma controlada en longitud, especificidad y estilo. El BFI-10 usa solo dos ítems por rasgo y no se informa fiabilidad en estas muestras. Los prompts avanzados son mucho más largos y prescriptivos que el baseline; RAG y few-shot incorporan ejemplos y el fine-tuning no documenta dataset final, split, hiperparámetros o evaluación. Por tanto, la comparación mezcla personalización, prompt, recuperación, entrenamiento y política de envío.
El contraste dentro de persona es el resultado más defendible. En los mensajes que sí se mostraron, ningún outcome tuvo una asociación trial-level creíble entre disponer de BFPT y la valoración inmediata según los intervalos del texto. Es decir, en esta evaluación de viñetas, dar al generador las puntuaciones Big Five no produjo una mejora detectable del mensaje personalizado frente al no personalizado para la misma persona. Tampoco hubo una ventaja consistente de RAG, fine-tuning o few-shot sobre el baseline. Esto no demuestra equivalencia: faltan márgenes de equivalencia, potencia, modelos fijados y una manipulación limpia, y el apéndice muestra que los pipelines tenían políticas de envío radicalmente distintas.
La principal afirmación positiva procede de una variable construida después de generar los datos: para cada participante, la proporción de mensajes entregados que pertenecía a configuraciones BFPT. Esa proporción varió solo de 40 % a 57 % (SD=0,03) porque cada LLM decidió de forma autónoma enviar o retener. No fue aleatorizada. De hecho, el modelo de envío del apéndice estima que few-shot, fine-tuned y RAG enviaban muchísimo menos que el baseline (OR 0,024, 0,008 y 0,046) y que las configuraciones sin BFPT enviaban más (OR 1,42). La “dosis” es así consecuencia de selección post-generación y composición de pipelines, no una exposición experimental administrada. Correlaciones pequeñas y VIF no eliminan confusión no medida, sesgo de selección ni collider bias.
Los modelos ordinales separan el indicador del mensaje de la media de cada persona y añaden intercepto y pendiente aleatorios por participante. Reportan asociaciones person-level favorables para personalización percibida, ajuste, engagement, efectividad y profesionalidad, y asociaciones negativas con cinco emociones adversas. Sin embargo, el predictor person-level contiene solo 90 unidades independientes y se repite en unas 2.345 filas; el diseño contiene además cinco escenarios y hasta ocho mensajes correlacionados por escenario, pero la fórmula solo modela participante. No se declaran priors, draws, posterior predictive checks, preregistro, análisis de potencia o sensibilidad a la selección. La convergencia MCMC no resuelve una especificación causal incompleta.
El manuscrito contiene contradicciones que impiden aceptar literalmente “14 de 17 outcomes”. La Tabla 6 da para happiness β=2,99 y HDI 97 % [0,34, 5,79], que excluiría cero y elevaría el total a 15; el texto imprime [-0,34, 5,79] y lo declara no creíble. La figura llama a los mismos intervalos “95% CI”. Se usan diecisiete outcomes con umbral HDI 97 % sin una justificación de multiplicidad. Además, los cuatro ítems de Perceived Message Relevance se analizan por separado en vez de como una escala validada y no se reporta consistencia interna. Las asociaciones de confusores del apéndice calculan p-values sobre filas repetidas como si fueran independientes, haciendo que correlaciones de 0,09–0,13 aparezcan como p=0,000.
También falla la contabilidad básica. Métodos afirma 77.280 ratings, mientras Resultados afirma 75.600. Con 2.345 mensajes entregados y 21 ítems, el máximo posible es 49.245 ratings; 75.600 corresponde a contar también las 1.255 decisiones sin mensaje y 77.280 equivaldría a 3.680 mensajes, más de las 3.600 decisiones posibles. La Tabla 5 confirma aproximadamente 2.340 observaciones por outcome. El apéndice de Big Five describe 92 participantes en la comparison study, cada distribución suma 92, no los 90 de texto y demografía, sin explicar dos exclusiones. También se escribe que los ICC van de “0,54% a 0,82%”, aunque los valores reales son 0,54–0,82, es decir 54–82 %.
Los ICC altos muestran sobre todo que las personas usan las escalas de forma estable durante una sesión larga; no confirman que la exposición BFPT haya creado esa estabilidad. Cada participante valoró en una misma interfaz múltiples variaciones del mismo contexto, potencialmente cientos de ítems, lo que puede producir consistencia de respuesta, fatiga, comparación directa y efectos de orden. El raw mean de emociones negativas contradice a veces la pendiente ajustada: el propio artículo reconoce que Q4 puede ser más negativo que Q1 y que más del 70 % marca el suelo. Atribuir la inversión solo al floor effect no prueba una reducción entre la minoría; muestra que esa conclusión depende del ajuste del modelo y no de la diferencia observada.
El artículo es más prudente en Limitations que en su framing. Reconoce que “person-level” significa diferencias entre personas en una única sesión, no cambio dentro de una persona a lo largo del tiempo, y que CAT se añadió post hoc. Por ello, los datos no observan acomodación acumulativa, rapport, confianza, relación terapéutica ni “relational infrastructure”. Tampoco observan que alguien reciba una serie coherente de mensajes de un mismo sistema: se comparan hasta ocho configuraciones independientes sin memoria histórica. CAT y la alianza terapéutica son hipótesis interpretativas para estudios futuros, no mecanismos demostrados.
La lectura fiel es, por tanto, más estrecha que el título. El estudio aporta un protocolo de viñetas y evidencia nula a nivel de mensaje para esta implementación de BFPT. Detecta además una asociación ecológica entre una proporción post hoc, no aleatorizada y de rango estrecho, y tendencias globales de rating entre 90 participantes. Esa asociación puede motivar un micro-randomized trial longitudinal, como proponen los propios autores, pero no demuestra dosis, acumulación, cambio relacional, eficacia JITAI, aumento de actividad física ni beneficio clínico. Antes de usarlo como recomendación de diseño hacen falta datos y código públicos, corrección de las inconsistencias, randomización explícita de densidad BFPT, exposición real repetida, manipulación comprobada, análisis jerárquico completo y outcomes conductuales.