Beyond Fixed Psychological Personas: State Beats Trait, but Language Models are State-Blind

Personas, identidad y agentes2026arXivRevisión editorial aprobada

Autores: Tamunotonye Harry, Ivoline Ngong, Chima Nweke, Yuanyuan Feng, Joseph Near

Palabras clave: Large Language Models, Personality, Persona, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
16
Hallazgos
40
Limitaciones
11
Evidencias

Resumen editorial

Español

El trabajo presenta Chameleon, un dataset de perfiles psicológicos inferidos a partir de 5.001 posts de 1.667 autores de Reddit, con tres posts por autor en tres subreddits distintos. La versión auditada es arXiv v2, revisada el 6 de mayo de 2026 y aceptada en Findings of ACL 2026. El corpus de origen es Webis-TLDR-17, cuyos textos datan de 2006–2016. Los autores operativizan “contexto” como subreddit y preguntan qué fracción de la variación de 26 dimensiones psicológicas aparece entre autores o dentro del mismo autor; después estudian si tres LLM diferencian seis arquetipos y si tres reward models puntúan de forma estable una respuesta idéntica al cambiar el perfil declarado del usuario.

La selección exige autores con posts de al menos 50 palabras en tres comunidades distintas y toma exactamente tres posts por persona. La ficha pública añade el seed 42, que no figura en el cuerpo principal. La muestra es muy desigual: AskReddit aporta 1.558 posts, relationships 923, relationship_advice 268, offmychest 198 y depression 129; esos cinco contextos concentran 61,51 % del total. De 645 subreddits, solo 41 tienen al menos diez posts y 433 aparecen una sola vez. Por tanto, “645 contextos” describe cobertura nominal, no una comparación equilibrada de situaciones. El requisito de longitud, presencia en tres comunidades y disponibilidad de TL;DR selecciona además un subconjunto particular de usuarios y escritura de Reddit.

Cada post recibe 26 scores: Big Five 5, valores de Schwartz 10, Self-Determination Theory 5 y DOSPERT 6, con 171 ítems en total. Hay dos rutas de features: SEANCE genera 254 indicadores léxicos y LangExtract usa GPT-4o para extraer patrones semánticos. Sin embargo, ambas rutas terminan en el mismo GPT-4o, que responde los ítems psicométricos como si fuera el autor condicionado por las features. No son dos mediciones independientes: comparten el mismo evaluador, sus supuestos, conocimiento y posibles sesgos; LangExtract usa además GPT-4o también en la etapa anterior. No hay autoinforme, conducta observada, anotación experta o ground truth psicológico.

El paper denomina ICC a su descomposición y reporta medias 0,26 para SEANCE, 0,28 para LangExtract y 0,27 para la fusión, interpretando 1−ICC como 72–74 % de “estado”. La auditoría independiente de los tres CSV públicos reproduce exactamente esos valores solo al calcular Var(media del usuario) / [Var(media del usuario) + media de la varianza intrausuario]: 0,25995, 0,27991 y 0,27311. Esa razón no corrige la varianza de la media debida a tener solo tres observaciones y no es el ICC(1,1) ANOVA estándar que el método afirma usar. Con k=3 y observaciones independientes, su valor esperado ya es 0,25 entre y 0,75 dentro; el resultado principal queda muy cerca de ese suelo matemático.

Aplicando ICC(1,1) estándar a los mismos datos se obtienen medias 0,0176 para SEANCE, 0,0524 para LangExtract y 0,0406 para combined, con rangos que incluyen valores ligeramente negativos. Esto indica consistencia entre posts muy baja, pero no identifica su causa. El residuo intraautor mezcla cambio contextual real, tema, momento, selección del post, error de SEANCE, variabilidad y sesgo de GPT-4o y cualquier otra fuente no modelada. Por eso ni 73 % ni 96 % pueden etiquetarse directamente como “estado psicológico”. La propia ecuación agrupa Var(estado)+Var(error), aunque la narrativa posterior suele atribuir el conjunto al contexto.

El control por subreddit tampoco aísla causalmente el contexto. Restar la media de cada comunidad reduce conjuntamente tema, estilo, composición de usuarios y cualquier señal compartida; para los 433 subreddits con un solo post convierte la observación entera en cero. El ICC residualizado pasa de 0,273 a 0,266 bajo la misma razón no corregida. Esa estabilidad no separa estado de error, ni prueba que las diferencias sean causadas por el subreddit; solo muestra que esa transformación agregada no eleva el estadístico.

La validación convergente es especialmente débil. Para la misma dimensión medida por ambos métodos, la correlación media es r=0,0605, con rango 0,0069–0,1040. El paper destaca en cambio correlaciones dentro de cada post a través de las 26 dimensiones: media 0,7088 y mediana 0,7586 en los CSV, porque las dos rutas conservan patrones de nivel y rango propios de escalas distintas. Cuando cada dimensión se z-normaliza a través del dataset, como exige la etapa de fusión descrita, la correlación media por perfil cae a 0,0448 y la mediana a 0,0462; solo 0,18 % supera 0,70. El r=0,71 no demuestra acuerdo de constructo y es incompatible con la interpretación de “dos métodos convergentes”.

Hay además drift directo entre método y artefacto. La ficha y el algoritmo dicen que cada método se normaliza por dimensión antes de promediar, pero las 26 columnas de combined son exactamente la media aritmética de los scores crudos de SEANCE y LangExtract, con error máximo 1,33×10⁻¹⁵. Conservan las escalas originales, no z-scores. Una fila, post c1ca6ie, carece de las seis dimensiones DOSPERT en LangExtract y combined; no hay política de imputación ni advertencia en la ficha. El paper también alterna DOSPERT 1–5 en el texto y 1–7 en apéndice y dataset card.

Los cinco contrastes “de literatura” recuperan diferencias esperadas: SuicideWatch y depression muestran más neuroticismo inferido, SuicideWatch menos competencia, y personalfinance más seguridad y achievement que AskReddit. Las diferencias crudas públicas reproducen casi directamente los betas, pero son validación interna y circular: las features contienen el vocabulario que define esas comunidades y GPT-4o conoce las asociaciones que se pretenden confirmar. SuicideWatch tiene solo 43 posts y personalfinance 49; no se informa corrección por las cinco hipótesis, diagnósticos del mixed model o sensibilidad a comunidades dominantes.

Los seis arquetipos se obtienen con k-means sobre perfiles fusionados z-normalizados y reciben etiquetas normativas como Distressed-Vulnerable, Driven-Assertive o Risk-Seeking-Detached. Con los datos públicos, fusión z-normalizada y seed 42 se reproduce el 50,75 % de usuarios en tres clusters distintos, coherente con el 50,7 % publicado. Sin embargo, silhouette estándar entre k=2 y k=10 favorece k=2 (aprox. 0,226) y no k=6 (aprox. 0,120); el paper no publica curva, seed, n_init, manejo del missing o criterio adicional. Los nombres, descripciones y afirmaciones sobre qué consejo “beneficia” a cada perfil son interpretación de los autores, no resultados validados con usuarios.

La aplicación generativa usa GPT-4o, Llama-3.1-8B y Qwen2.5-14B sobre 127 preguntas y siete condiciones, una combinación por modelo, pregunta y condición: 2.667 respuestas. No se fijan checkpoints completos, proveedor, fecha, temperatura, top-p, seeds, repeticiones o fallos. La similitud media entre condiciones es 0,768, 0,819 y 0,846; el ANOVA entre arquetipos da F=2,18 y p=0,054. Un test no significativo casi en 0,05 no es una prueba de equivalencia ni de ceguera al estado, y las comparaciones por pares comparten pregunta, modelo y condiciones.

Más importante, el prompt publicado no pide al asistente adaptar una respuesta a un usuario: el system dice “You are a person with the following characteristics” y “Respond authentically as this person”. El experimento mide role-play del propio modelo bajo una persona, mientras el texto lo interpreta como asistencia personalizada a un usuario ansioso o seguro. Esta discordancia de constructo impide concluir que los LLM sean “state-blind” ante el estado de su interlocutor. Tampoco hay respuestas humanas adaptadas, judge de adecuación, criterio de utilidad o equivalence bounds.

La aplicación de reward models genera una respuesta base de GPT-4o para cada pregunta y la puntúa sin perfil y con seis perfiles usando DeBERTa-RM, Skywork-RM-8B y ArmoRM-8B. ArmoRM sube scores y los otros dos los bajan, con d entre aproximadamente 0,31 y 1,16 en magnitud. Pero no se identifican checkpoints exactos ni templates oficiales, y añadir una ficha larga cambia longitud y distribución del input respecto al baseline. No existe preferencia humana de referencia. Además, exigir invariancia total es discutible: si la calidad incluye adecuación al usuario, una misma respuesta puede ser más o menos apropiada según sus necesidades. La dirección opuesta muestra desacuerdo entre scorers bajo este prompt; no demuestra que uno priorice y otro depriorice de hecho a personas vulnerables ni que ese efecto se propague automáticamente a un sistema RLHF.

El artefacto público de Hugging Face contiene tres CSV, README y metadatos CC BY 4.0 en el commit 39aa8097644eb3d64e87e802c1d9f0f16f846287. No contiene código de muestreo, SEANCE/LangExtract, prompts ejecutables, llamadas GPT-4o, cálculo de ICC, regresiones, clustering, generación, embeddings o reward models; tampoco outputs, dependencias, lockfile, tests, CI o logs. El paper afirma liberar “dataset and code”, pero la única footnote enlaza el dataset y una búsqueda dirigida no localizó repositorio de código. Se pueden auditar los CSV, no reproducir el pipeline ni las dos aplicaciones.

La privacidad requiere una cautela mayor que la ficha. Aunque user_id está seudonimizado y no se incluye texto, cada post_id se publica y el README explica que coincide exactamente con id en Webis-TLDR-17. Ese corpus expone author, body, content y subreddit, por lo que el enlace permite recuperar texto y nombre de autor, incluidos posts de depression y SuicideWatch. La omisión del texto reduce comodidad de acceso, pero no evita reidentificación. No se documentan consentimiento, borrado, evaluación de riesgo, revisión ética independiente o manejo de inferencias psicológicas sensibles; solo se declara que no cumple la definición federal de human-subjects research.

La contribución defendible es un recurso exploratorio que enlaza tres textos por autor con dos familias de scores inferidos y muestra muy baja consistencia entre posts, asociaciones fuertes con el contenido del subreddit y sensibilidad de generadores y reward models a fichas de persona. No demuestra que 74 % de la psicología humana sea estado, que el subreddit cause el cambio, que los perfiles sean válidos, que dos métodos independientes converjan, que los LLM ignoren el estado de usuarios reales ni que los reward models discriminen a personas vulnerables en despliegue.

English

The paper introduces Chameleon, a dataset of inferred psychological profiles for 5,001 posts from 1,667 Reddit authors, with three posts per author from three distinct subreddits. The audited version is arXiv v2, revised on 6 May 2026 and accepted to Findings of ACL 2026. Source texts come from Webis-TLDR-17 and date from 2006–2016. The authors operationalize context as subreddit and ask what fraction of variation in 26 psychological dimensions appears between authors or within the same author. They then test whether three LLMs differentiate six archetypes and whether three reward models score an identical response consistently when the stated user profile changes.

Sampling requires authors with at least 50-word posts in three distinct communities and takes exactly three posts per person. The public card adds random seed 42, which is absent from the main paper. The sample is highly uneven: AskReddit contributes 1,558 posts, relationships 923, relationship_advice 268, offmychest 198, and depression 129; these five contexts account for 61.51% of all rows. Of 645 subreddits, only 41 have at least ten posts and 433 occur once. Thus “645 contexts” is nominal coverage, not a balanced comparison of situations. Length, three-community, and TL;DR availability criteria also select a particular subset of Reddit users and writing.

Each post receives 26 scores: five Big Five, ten Schwartz values, five Self-Determination Theory, and six DOSPERT dimensions, totaling 171 items. Two feature routes are used: SEANCE produces 254 lexical indicators and LangExtract uses GPT-4o to extract semantic patterns. Both routes, however, terminate in the same GPT-4o answering psychometric items as if it were the author while conditioned on those features; LangExtract also uses GPT-4o upstream. These are not independent measurements because they share the same assessor, assumptions, knowledge, and potential biases. There are no self-reports, observed behavior, expert annotations, or psychological ground truth.

The paper calls its decomposition an ICC and reports means of 0.26 for SEANCE, 0.28 for LangExtract, and 0.27 for the fused data, interpreting 1−ICC as 72–74% “state.” Independent analysis of the three public CSVs reproduces those values exactly only as Var(user mean) / [Var(user mean) + mean within-user variance]: 0.25995, 0.27991, and 0.27311. This ratio does not correct user-mean variance for having only three observations and is not the standard one-way random-effects ICC(1,1) claimed by the method. With k=3 independent observations, its expectation is already 0.25 between and 0.75 within, placing the headline finding close to a mathematical floor.

Applying standard ANOVA ICC(1,1) to the same data yields means of 0.0176 for SEANCE, 0.0524 for LangExtract, and 0.0406 for combined, with ranges including slightly negative values. This indicates very low consistency across posts, but it does not identify why. Within-author residual variance mixes genuine contextual change, topic, time, post selection, SEANCE error, GPT-4o variability and bias, and all other unmodeled sources. Neither 73% nor 96% can therefore be labeled directly as psychological state. The paper's own equation combines state variance and error variance, although later prose often attributes the whole residual to context.

The subreddit control does not causally isolate context. Subtracting each community mean jointly removes topic, style, user composition, and any shared signal; for 433 singleton subreddits it turns the entire observation into zero. Residualized ICC moves from 0.273 to 0.266 under the same uncorrected ratio. This stability does not separate state from error or prove that subreddit caused the differences; it only shows that this aggregate transformation does not increase the statistic.

Convergent validity is particularly weak. Correlation for the same dimension across the two methods averages r=0.0605, range 0.0069–0.1040. The paper instead emphasizes within-post correlation across the 26 dimensions: mean 0.7088 and median 0.7586 in the public CSVs, because both routes preserve level and range patterns associated with different scales. When every dimension is z-normalized across the dataset, as the described fusion stage requires, mean profile correlation falls to 0.0448 and median to 0.0462; only 0.18% exceed 0.70. The reported r=0.71 does not establish construct agreement and cannot support the claim of converging independent methods.

There is also direct method–artifact drift. The dataset card and algorithm say each method is normalized per dimension before averaging, but all 26 combined columns are exactly the raw arithmetic mean of SEANCE and LangExtract, with maximum error 1.33×10⁻¹⁵. They retain original response scales rather than z-scores. One row, post c1ca6ie, lacks all six DOSPERT dimensions in LangExtract and combined, with no imputation policy or card warning. The paper also alternates between a 1–5 DOSPERT scale in the main text and 1–7 in the appendix and dataset card.

Five literature-driven contrasts recover expected differences: SuicideWatch and depression show higher inferred neuroticism, SuicideWatch lower competence, and personalfinance higher security and achievement than AskReddit. Public raw mean differences almost directly reproduce the reported coefficients, but this is internal and circular validation: features contain vocabulary defining those communities and GPT-4o knows the associations being “confirmed.” SuicideWatch has only 43 posts and personalfinance 49; the paper reports no correction across the five hypotheses, mixed-model diagnostics, or sensitivity to dominant communities.

Six archetypes are produced by k-means over z-normalized fused profiles and receive normative labels such as Distressed-Vulnerable, Driven-Assertive, and Risk-Seeking-Detached. Public data, z-normalized fusion, and seed 42 reproduce 50.75% of users occupying three distinct clusters, matching the reported 50.7%. Standard silhouette analysis over k=2–10, however, favors k=2 at about 0.226 rather than k=6 at about 0.120; the paper provides no curve, seed, n_init, missing-data rule, or additional selection criterion. Labels, descriptions, and claims about what advice “benefits” each profile are author interpretations, not user-validated results.

The generation application uses GPT-4o, Llama-3.1-8B, and Qwen2.5-14B over 127 questions and seven conditions, one model–question–condition response each: 2,667 responses. Full checkpoints, provider, date, temperature, top-p, seeds, replications, and failures are not reported. Mean similarity across conditions is 0.768, 0.819, and 0.846; the archetype ANOVA gives F=2.18 and p=0.054. A non-significant test just above 0.05 is not evidence of equivalence or state blindness, and pairwise comparisons share questions, models, and conditions.

More importantly, the published prompt does not ask an assistant to adapt to a user. Its system instruction says “You are a person with the following characteristics” and “Respond authentically as this person.” The experiment measures the model's role-play under an assigned persona, while the paper interprets it as personalized assistance to an anxious or confident interlocutor. This construct mismatch prevents concluding that LLMs are state-blind to user state. There are also no human-adapted responses, appropriateness judges, utility criteria, or equivalence bounds.

The reward-model application generates one baseline GPT-4o response per question and scores it without a profile and under six profiles using DeBERTa-RM, Skywork-RM-8B, and ArmoRM-8B. ArmoRM raises scores while the other two lower them, with absolute d values roughly 0.31–1.16. Exact checkpoints and official templates are missing, and adding a long profile changes prompt length and input distribution relative to baseline. No human preference reference exists. Total state invariance is also debatable: if quality includes user appropriateness, the same response can legitimately fit different needs differently. Opposite directions show scorer disagreement under this prompt; they do not prove that deployed systems prioritize or deprioritize vulnerable people or that the effect automatically propagates through RLHF.

The public Hugging Face artifact contains three CSVs, a README, and CC BY 4.0 metadata at commit 39aa8097644eb3d64e87e802c1d9f0f16f846287. It contains no code for sampling, SEANCE/LangExtract, executable prompts, GPT-4o calls, ICCs, regressions, clustering, generation, embeddings, or reward models, and no outputs, dependencies, lockfile, tests, CI, or logs. The paper says it releases “dataset and code,” but its only footnote links the dataset and a targeted search found no code repository. The CSVs are auditable; the pipeline and two applications are not reproducible.

Privacy needs stronger caution than the card provides. Although user_id is pseudonymized and text is omitted, every post_id is public and the README explicitly says it matches id in Webis-TLDR-17. That corpus exposes author, body, content, and subreddit, so joining recovers text and author names, including depression and SuicideWatch posts. Omitting text reduces convenience but does not prevent reidentification. The release documents no consent, deletion process, risk assessment, independent ethics review, or handling of sensitive psychological inferences; it only states that the research does not meet the US federal human-subjects definition.

The defensible contribution is an exploratory resource linking three texts per author to two families of inferred scores and showing very low across-post consistency, strong associations with subreddit content, and sensitivity of generators and reward models to persona cards. It does not establish that 74% of human psychology is state, that subreddit causes change, that profiles are valid, that independent methods converge, that LLMs ignore real users' state, or that reward models discriminate against vulnerable people in deployment.

Pregunta de investigación

¿Cuánta variación de perfiles psicológicos inferidos desde posts de Reddit aparece entre autores o dentro del mismo autor y cómo reaccionan LLM generadores y reward models ante seis perfiles derivados?

Método

Muestra de 5.001 posts de Webis-TLDR-17, tres por cada uno de 1.667 autores y en tres subreddits distintos. SEANCE y LangExtract extraen features; GPT-4o responde 171 ítems para producir 26 dimensiones. El estudio calcula una razón de varianzas presentada como ICC, cinco contrastes por subreddit, k-means con seis arquetipos, similitud MPNet en 2.667 respuestas de tres LLM y scores de tres reward models sobre 127 respuestas idénticas bajo siete condiciones. La auditoría revisa las 29 páginas, TeX v2, los tres CSV de Hugging Face y reanálisis estadístico independiente.

Muestra: 1.667 autores con tres posts cada uno, exactamente 5.001 observaciones en 645 subreddits. AskReddit aporta 1.558, relationships 923 y los cinco subreddits principales 3.076 posts, 61,51 %. Solo 41 comunidades tienen n≥10 y 433 tienen n=1. Application A cruza 3 modelos × 127 preguntas × 7 condiciones = 2.667 respuestas, aparentemente una por celda. Application B puntúa 127 respuestas de GPT-4o bajo 7 condiciones con 3 reward models.

Hallazgos

  • La tabla ICC publicada se reproduce como razón no corregida de varianzas: 0,25995 SEANCE, 0,27991 LangExtract y 0,27311 combined.
  • Con tres observaciones independientes por usuario, esa razón ya espera 75 % dentro; el titular 72–74 % está cerca del suelo de diseño.
  • ICC(1,1) ANOVA estándar sobre los mismos CSV da medias 0,0176, 0,0524 y 0,0406.
  • El residuo intrausuario combina estado, contenido, tiempo y error de medición; no puede atribuirse por completo a contexto.
  • La correlación same-dimension entre métodos es r=0,0605 de media.
  • La correlación raw dentro del perfil reproduce r=0,7088, pero tras z-normalizar cada dimensión cae a r=0,0448.
  • El archivo combined es exactamente la media de scores crudos, no la media z-normalizada descrita.
  • Una fila carece de las seis dimensiones DOSPERT en LangExtract y combined.
  • Los cinco contrastes de subreddit siguen las direcciones esperadas, pero usan el mismo contenido del contexto y un assessor GPT-4o sin ground truth externo.
  • Con fusión z-normalizada y seed 42 se reproduce 50,75 % de usuarios en tres clusters.
  • Silhouette estándar sobre k=2–10 favorece k=2, no los seis arquetipos publicados.
  • Los tres generadores producen similitud media 0,768–0,846 y el efecto de arquetipo reportado queda en p=0,054.
  • El prompt de Application A pide al modelo encarnar el perfil, no asistir a un usuario con ese perfil.
  • Los reward models cambian mucho sus scores con la ficha y discrepan en signo, sin preferencia humana de referencia.
  • El dataset público es estructuralmente consistente en claves: 5.001 post_id únicos, 1.667 user_id y tres subreddits distintos por usuario.
  • No hay repositorio público que permita reproducir extracción, estadística o aplicaciones.

Limitaciones

  • Subreddit mezcla tema, audiencia, normas, estilo y situación; no es una manipulación causal de estado.
  • Solo hay tres observaciones por autor y no hay repetición dentro del mismo autor×contexto.
  • La selección requiere tres subreddits, al menos 50 palabras, inglés y TL;DR, generando sesgo de muestra.
  • La distribución de contextos está muy concentrada y 433 comunidades son singletons.
  • El control por media de subreddit borra por completo los singletons y no separa estilo de psicología.
  • La razón publicada no es el ICC(1,1) estándar y tiene un suelo por k=3.
  • 1−ICC incluye error de medición y no equivale a estado contextual.
  • Ambos métodos usan el mismo GPT-4o como assessor y no son independientes.
  • LangExtract usa GPT-4o también en feature extraction, aumentando dependencia y circularidad.
  • No se reportan snapshot GPT-4o, temperatura, top-p, seed, retries, fecha de ejecución o tasa de fallo.
  • No hay autoinformes, ecological momentary assessment, anotación clínica o validación humana.
  • El acuerdo convergente same-trait es extremadamente bajo.
  • El acuerdo r=0,71 se calcula a través de escalas heterogéneas y desaparece con normalización por dimensión.
  • El combined público contradice la fusión z-normalizada descrita.
  • Una fila tiene seis missing y no hay regla de imputación documentada.
  • La escala DOSPERT aparece como 1–5 y 1–7 en distintas partes.
  • Los contrastes de validación pueden reflejar vocabulario de depresión, suicidio o finanzas incorporado al assessor.
  • SuicideWatch n=43 y personalfinance n=49 son muestras pequeñas frente a AskReddit n=1.558.
  • No se reporta corrección por cinco hipótesis ni diagnósticos completos de mixed models.
  • K=6 no queda justificado por silhouette en el artefacto público.
  • No se publican seeds, n_init, algoritmo, missing handling o estabilidad de clustering.
  • Los arquetipos convierten scores no validados en etiquetas sensibles y recomendaciones normativas.
  • No hay validación humana de los nombres o beneficios atribuidos a cada arquetipo.
  • Application A usa una sola generación por celda y no separa sampling noise de efecto de perfil.
  • No se fijan checkpoints exactos de los tres generadores.
  • Las comparaciones semánticas por pares son dependientes dentro de pregunta, modelo y condición.
  • P=0,054 no demuestra equivalencia; faltan bounds y potencia.
  • El prompt hace role-play del asistente, no personalización hacia el usuario.
  • No hay evaluación de utilidad, seguridad, tono apropiado o preferencia de usuarios reales.
  • Los 50 dilemas son construidos por autores y no se validan externamente.
  • Application B cambia longitud y distribución del prompt al añadir perfiles.
  • Los reward models y chat templates exactos no se identifican.
  • No hay gold standard humano para decidir qué dirección de reward es correcta.
  • La state-invariance total puede ser un criterio incorrecto cuando la adecuación depende del usuario.
  • El efecto de una ficha sobre un reward model no demuestra propagación causal a RLHF.
  • No hay código, outputs, dependencias fijadas, tests, CI o logs para reproducir el paper.
  • Los post_id enlazan con un corpus que contiene author y texto, permitiendo reidentificación.
  • La muestra incluye inferencias sensibles sobre posts de depression y SuicideWatch.
  • No se documentan consentimiento, retirada, borrado, riesgo de reidentificación o revisión ética independiente.
  • El corpus 2006–2016 y Reddit en inglés limitan generalización temporal, cultural y de plataforma.

Qué no demuestra

  • No establece que 72–74 % de la psicología de una persona sea estado contextual.
  • No separa cambio psicológico real de error de inferencia o variación textual.
  • No demuestra que el subreddit cause los perfiles inferidos.
  • No valida los scores como Big Five, valores, motivación o riesgo reales.
  • No muestra convergencia de dos métodos independientes.
  • No justifica seis tipos psicológicos discretos como estructura natural de los datos.
  • No demuestra que un usuario cambie de personalidad entre comunidades.
  • No prueba que LLM desplegados ignoren el estado de su interlocutor.
  • No distingue rigidez de alignment de prompt design, checkpoint o sampling.
  • No demuestra discriminación contra usuarios vulnerables por reward models desplegados.
  • No prueba que los signos de reward produzcan de forma causal priorización en RLHF.
  • No permite reproducir el pipeline completo con los artefactos liberados.
  • No garantiza anonimato efectivo de autores o textos fuente.
  • No generaliza a usuarios consentidos, otras plataformas, idiomas, periodos o interacciones reales.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2601.15395v2, revised 6 May 2026; accepted to Findings of ACL 2026; 29 pages

Fuente consultada: https://arxiv.org/pdf/2601.15395v2

Revisión: Codex full-text, bilingual-fidelity, arXiv-v2, 29-page visual, TeX-source, Hugging-Face-Dataset-Viewer, three-CSV, ICC-reanalysis, convergence, fusion-drift, clustering, prompt-construct, reward-model, reproducibility, privacy and ethics audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • GPT-4o as LangExtract backend; exact snapshot and decoding configuration not reported
  • GPT-4o as shared psychometric scale assessor for both feature routes; exact snapshot not reported
  • GPT-4o generation model in Application A; exact snapshot not reported
  • Llama-3.1-8B generation model in Application A; exact checkpoint not reported
  • Qwen2.5-14B generation model in Application A; exact checkpoint not reported
  • all-mpnet-base-v2 sentence-embedding model
  • DeBERTa-RM reward model; exact checkpoint not reported
  • Skywork-RM-8B reward model; exact checkpoint not reported
  • ArmoRM-8B reward model; exact checkpoint not reported

Instrumentos y métricas

  • Big Five Inventory, 44 items and 5 dimensions
  • Schwartz Value Survey, 57 items and 10 dimensions
  • Self-Determination Theory scales, 33 items and 5 dimensions
  • DOSPERT, 40 items and 6 dimensions
  • SEANCE, 254 lexical and social-cognition features
  • LangExtract semantic-pattern extraction with GPT-4o
  • GPT-4o item-response simulation conditioned on extracted features
  • Published uncorrected between-versus-within variance ratio labeled ICC
  • Standard ANOVA ICC(1,1) in the independent artifact reanalysis
  • Cross-method same-dimension and within-profile Pearson correlations
  • Linear mixed-effects subreddit contrasts
  • K-means clustering and silhouette analysis
  • all-mpnet-base-v2 pairwise semantic similarity
  • Cohen d and eta-squared reward-model comparisons

Datos utilizados

  • Chameleon combined config, 5,001 rows and 29 columns
  • Chameleon SEANCE config, 5,001 rows and 29 columns
  • Chameleon LangExtract config, 5,001 rows and 29 columns
  • Webis-TLDR-17 Reddit corpus, 3,848,330 posts from 2006–2016
  • 77 GlobalOpinionQA questions
  • 50 author-written psychological dilemma scenarios
  • No public generation outputs, reward scores, extraction code, analysis code or run logs

Evidencia y localización

  • Versión, autores, historial y aceptación: Official arXiv:2601.15395 page and v2 PDF, revised 6 May 2026, accepted to Findings of ACL 2026
  • Muestra, extracción, ICC, validación y aplicaciones: arXiv v2 PDF, pp. 1–9 and Appendices C–H, pp. 16–29
  • Prompt de role-play y reward prompt: arXiv v2 PDF, Appendix C.2–C.3, p. 17
  • Descomposición y correlaciones publicadas: arXiv v2 PDF, Tables 3–4, Figures 3–6, pp. 5–7 and 18–19
  • Arquetipos, clustering y control residualizado: arXiv v2 PDF, Appendices G–H, pp. 24–29
  • Artefacto público y drift de fusión: Hugging Face tonyeh/chameleon-dataset commit 39aa8097644eb3d64e87e802c1d9f0f16f846287; three CSVs and README audited 15 July 2026
  • Reanálisis independiente ICC, convergencia y clustering: All 15,003 public config rows queried; CSV SHA-256 combined 28f9e95c..., SEANCE 104ae03f..., LangExtract c1b39a00...; Python reanalysis on 15 July 2026
  • Claves, missing y distribución de subreddits: Hugging Face Dataset Viewer API, size/statistics/parquet endpoints and full CSV audit, 15 July 2026
  • Riesgo de enlace y reidentificación: Chameleon README maps post_id to Webis-TLDR-17 id; Webis-TLDR-17 schema exposes author, body, content and subreddit
  • Ausencia de código reproducible: Hugging Face repository tree, official arXiv TeX source and targeted GitHub/title/author search audited 15 July 2026
  • Inspección visual integral: All 29 arXiv v2 PDF pages rendered and visually reviewed