El trabajo presenta Chameleon, un dataset de perfiles psicológicos inferidos a partir de 5.001 posts de 1.667 autores de Reddit, con tres posts por autor en tres subreddits distintos. La versión auditada es arXiv v2, revisada el 6 de mayo de 2026 y aceptada en Findings of ACL 2026. El corpus de origen es Webis-TLDR-17, cuyos textos datan de 2006–2016. Los autores operativizan “contexto” como subreddit y preguntan qué fracción de la variación de 26 dimensiones psicológicas aparece entre autores o dentro del mismo autor; después estudian si tres LLM diferencian seis arquetipos y si tres reward models puntúan de forma estable una respuesta idéntica al cambiar el perfil declarado del usuario.
La selección exige autores con posts de al menos 50 palabras en tres comunidades distintas y toma exactamente tres posts por persona. La ficha pública añade el seed 42, que no figura en el cuerpo principal. La muestra es muy desigual: AskReddit aporta 1.558 posts, relationships 923, relationship_advice 268, offmychest 198 y depression 129; esos cinco contextos concentran 61,51 % del total. De 645 subreddits, solo 41 tienen al menos diez posts y 433 aparecen una sola vez. Por tanto, “645 contextos” describe cobertura nominal, no una comparación equilibrada de situaciones. El requisito de longitud, presencia en tres comunidades y disponibilidad de TL;DR selecciona además un subconjunto particular de usuarios y escritura de Reddit.
Cada post recibe 26 scores: Big Five 5, valores de Schwartz 10, Self-Determination Theory 5 y DOSPERT 6, con 171 ítems en total. Hay dos rutas de features: SEANCE genera 254 indicadores léxicos y LangExtract usa GPT-4o para extraer patrones semánticos. Sin embargo, ambas rutas terminan en el mismo GPT-4o, que responde los ítems psicométricos como si fuera el autor condicionado por las features. No son dos mediciones independientes: comparten el mismo evaluador, sus supuestos, conocimiento y posibles sesgos; LangExtract usa además GPT-4o también en la etapa anterior. No hay autoinforme, conducta observada, anotación experta o ground truth psicológico.
El paper denomina ICC a su descomposición y reporta medias 0,26 para SEANCE, 0,28 para LangExtract y 0,27 para la fusión, interpretando 1−ICC como 72–74 % de “estado”. La auditoría independiente de los tres CSV públicos reproduce exactamente esos valores solo al calcular Var(media del usuario) / [Var(media del usuario) + media de la varianza intrausuario]: 0,25995, 0,27991 y 0,27311. Esa razón no corrige la varianza de la media debida a tener solo tres observaciones y no es el ICC(1,1) ANOVA estándar que el método afirma usar. Con k=3 y observaciones independientes, su valor esperado ya es 0,25 entre y 0,75 dentro; el resultado principal queda muy cerca de ese suelo matemático.
Aplicando ICC(1,1) estándar a los mismos datos se obtienen medias 0,0176 para SEANCE, 0,0524 para LangExtract y 0,0406 para combined, con rangos que incluyen valores ligeramente negativos. Esto indica consistencia entre posts muy baja, pero no identifica su causa. El residuo intraautor mezcla cambio contextual real, tema, momento, selección del post, error de SEANCE, variabilidad y sesgo de GPT-4o y cualquier otra fuente no modelada. Por eso ni 73 % ni 96 % pueden etiquetarse directamente como “estado psicológico”. La propia ecuación agrupa Var(estado)+Var(error), aunque la narrativa posterior suele atribuir el conjunto al contexto.
El control por subreddit tampoco aísla causalmente el contexto. Restar la media de cada comunidad reduce conjuntamente tema, estilo, composición de usuarios y cualquier señal compartida; para los 433 subreddits con un solo post convierte la observación entera en cero. El ICC residualizado pasa de 0,273 a 0,266 bajo la misma razón no corregida. Esa estabilidad no separa estado de error, ni prueba que las diferencias sean causadas por el subreddit; solo muestra que esa transformación agregada no eleva el estadístico.
La validación convergente es especialmente débil. Para la misma dimensión medida por ambos métodos, la correlación media es r=0,0605, con rango 0,0069–0,1040. El paper destaca en cambio correlaciones dentro de cada post a través de las 26 dimensiones: media 0,7088 y mediana 0,7586 en los CSV, porque las dos rutas conservan patrones de nivel y rango propios de escalas distintas. Cuando cada dimensión se z-normaliza a través del dataset, como exige la etapa de fusión descrita, la correlación media por perfil cae a 0,0448 y la mediana a 0,0462; solo 0,18 % supera 0,70. El r=0,71 no demuestra acuerdo de constructo y es incompatible con la interpretación de “dos métodos convergentes”.
Hay además drift directo entre método y artefacto. La ficha y el algoritmo dicen que cada método se normaliza por dimensión antes de promediar, pero las 26 columnas de combined son exactamente la media aritmética de los scores crudos de SEANCE y LangExtract, con error máximo 1,33×10⁻¹⁵. Conservan las escalas originales, no z-scores. Una fila, post c1ca6ie, carece de las seis dimensiones DOSPERT en LangExtract y combined; no hay política de imputación ni advertencia en la ficha. El paper también alterna DOSPERT 1–5 en el texto y 1–7 en apéndice y dataset card.
Los cinco contrastes “de literatura” recuperan diferencias esperadas: SuicideWatch y depression muestran más neuroticismo inferido, SuicideWatch menos competencia, y personalfinance más seguridad y achievement que AskReddit. Las diferencias crudas públicas reproducen casi directamente los betas, pero son validación interna y circular: las features contienen el vocabulario que define esas comunidades y GPT-4o conoce las asociaciones que se pretenden confirmar. SuicideWatch tiene solo 43 posts y personalfinance 49; no se informa corrección por las cinco hipótesis, diagnósticos del mixed model o sensibilidad a comunidades dominantes.
Los seis arquetipos se obtienen con k-means sobre perfiles fusionados z-normalizados y reciben etiquetas normativas como Distressed-Vulnerable, Driven-Assertive o Risk-Seeking-Detached. Con los datos públicos, fusión z-normalizada y seed 42 se reproduce el 50,75 % de usuarios en tres clusters distintos, coherente con el 50,7 % publicado. Sin embargo, silhouette estándar entre k=2 y k=10 favorece k=2 (aprox. 0,226) y no k=6 (aprox. 0,120); el paper no publica curva, seed, n_init, manejo del missing o criterio adicional. Los nombres, descripciones y afirmaciones sobre qué consejo “beneficia” a cada perfil son interpretación de los autores, no resultados validados con usuarios.
La aplicación generativa usa GPT-4o, Llama-3.1-8B y Qwen2.5-14B sobre 127 preguntas y siete condiciones, una combinación por modelo, pregunta y condición: 2.667 respuestas. No se fijan checkpoints completos, proveedor, fecha, temperatura, top-p, seeds, repeticiones o fallos. La similitud media entre condiciones es 0,768, 0,819 y 0,846; el ANOVA entre arquetipos da F=2,18 y p=0,054. Un test no significativo casi en 0,05 no es una prueba de equivalencia ni de ceguera al estado, y las comparaciones por pares comparten pregunta, modelo y condiciones.
Más importante, el prompt publicado no pide al asistente adaptar una respuesta a un usuario: el system dice “You are a person with the following characteristics” y “Respond authentically as this person”. El experimento mide role-play del propio modelo bajo una persona, mientras el texto lo interpreta como asistencia personalizada a un usuario ansioso o seguro. Esta discordancia de constructo impide concluir que los LLM sean “state-blind” ante el estado de su interlocutor. Tampoco hay respuestas humanas adaptadas, judge de adecuación, criterio de utilidad o equivalence bounds.
La aplicación de reward models genera una respuesta base de GPT-4o para cada pregunta y la puntúa sin perfil y con seis perfiles usando DeBERTa-RM, Skywork-RM-8B y ArmoRM-8B. ArmoRM sube scores y los otros dos los bajan, con d entre aproximadamente 0,31 y 1,16 en magnitud. Pero no se identifican checkpoints exactos ni templates oficiales, y añadir una ficha larga cambia longitud y distribución del input respecto al baseline. No existe preferencia humana de referencia. Además, exigir invariancia total es discutible: si la calidad incluye adecuación al usuario, una misma respuesta puede ser más o menos apropiada según sus necesidades. La dirección opuesta muestra desacuerdo entre scorers bajo este prompt; no demuestra que uno priorice y otro depriorice de hecho a personas vulnerables ni que ese efecto se propague automáticamente a un sistema RLHF.
El artefacto público de Hugging Face contiene tres CSV, README y metadatos CC BY 4.0 en el commit 39aa8097644eb3d64e87e802c1d9f0f16f846287. No contiene código de muestreo, SEANCE/LangExtract, prompts ejecutables, llamadas GPT-4o, cálculo de ICC, regresiones, clustering, generación, embeddings o reward models; tampoco outputs, dependencias, lockfile, tests, CI o logs. El paper afirma liberar “dataset and code”, pero la única footnote enlaza el dataset y una búsqueda dirigida no localizó repositorio de código. Se pueden auditar los CSV, no reproducir el pipeline ni las dos aplicaciones.
La privacidad requiere una cautela mayor que la ficha. Aunque user_id está seudonimizado y no se incluye texto, cada post_id se publica y el README explica que coincide exactamente con id en Webis-TLDR-17. Ese corpus expone author, body, content y subreddit, por lo que el enlace permite recuperar texto y nombre de autor, incluidos posts de depression y SuicideWatch. La omisión del texto reduce comodidad de acceso, pero no evita reidentificación. No se documentan consentimiento, borrado, evaluación de riesgo, revisión ética independiente o manejo de inferencias psicológicas sensibles; solo se declara que no cumple la definición federal de human-subjects research.
La contribución defendible es un recurso exploratorio que enlaza tres textos por autor con dos familias de scores inferidos y muestra muy baja consistencia entre posts, asociaciones fuertes con el contenido del subreddit y sensibilidad de generadores y reward models a fichas de persona. No demuestra que 74 % de la psicología humana sea estado, que el subreddit cause el cambio, que los perfiles sean válidos, que dos métodos independientes converjan, que los LLM ignoren el estado de usuarios reales ni que los reward models discriminen a personas vulnerables en despliegue.