Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs

Inducción y control de rasgos2026ACL AnthologyRevisión editorial aprobada

Autores: Pranav Bhandari, Nicolas Fay, Sanjeevan Selvaganapathy, Amitava Datta, Usman Naseem, Mehwish Nasim

Palabras clave: Large Language Models, Personality, Big Five, Persona, Personality Control

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

6
Autores
37
Hallazgos
61
Limitaciones
16
Evidencias

Resumen editorial

Español

Este artículo largo de EACL 2026 propone Activation-Space Personality Steering, un método de intervención en activaciones para desplazar la expresión textual de cinco etiquetas OCEAN sin modificar los pesos del modelo. La revisión usa la versión definitiva de ACL Anthology, no el registro arXiv de 2025, e inspecciona visualmente sus 16 páginas. El método produce separaciones High–Low visibles en las puntuaciones publicadas, pero la evidencia no respalda varias afirmaciones más amplias del abstract sobre un subespacio psicológico compartido, estabilidad, interpretabilidad o ausencia de impacto en capacidades.

Para cada rasgo, el estudio toma ejemplos High/Low de Big5-Chat, extrae el último estado residual no-padding por capa, calcula diferencias normalizadas de medias y agrega capas con pesos no negativos cuyo aprendizaje no se especifica. Los cinco vectores agregados se proyectan mediante PCA sobre tres componentes. Una capa offline por rasgo se elige combinando cambio L2, KL y flip del token; una capa dinámica por prompt maximiza el cambio de logits. La intervención mezcla ambas capas con pesos heurísticos 0,8/0,2, calibra la polaridad con prompts etiquetados e inyecta una dirección escalada en cada paso de decodificación. La intensidad α se barre empíricamente entre 4 y 12 y se elige para que una supuesta puntuación de fluidez no baje de 3,5.

Se evalúan Llama-3-8B-Instruct, Ministral-8B-Instruct-2410, Mistral-Small-24B-Instruct-2501, Qwen2.5-14B-Instruct y Gemma-3-4B-IT con temperatura 0,4, top-p 0,95, top-k 50 y repetition penalty 1,1. Un juez GPT no identificado puntúa rasgo y “fluidez” sobre preguntas tipo BFI y escenarios derivados de SocialIQA; no se publican modelo del juez, número de prompts, repeticiones, incertidumbre, acuerdo humano o tests. Las diferencias High–Low derivadas de la Tabla 1 son 1,0–3,5 puntos en la escala 1–5. Para Llama, el promedio es 2,64; en la ablación publicada, hybrid supera a offline-only y dynamic-only, también con 2,64 frente a 1,47 y 0,98. Esto muestra control sobre el criterio del juez en esos prompts, no que el modelo haya adquirido personalidad humana estable.

La validación de baja dimensión usa solo cinco observaciones-vector por modelo: una por rasgo. Tres componentes explican 96,31% en Llama, 96,35% en Ministral-8B, 95,91% en Mistral-24B y 93,37% en Qwen. Por tanto, el dato publicado es “más de 90%”, no “más de 95%” para todos; Gemma se omite de esa tabla. No hay comparación con vectores sin PCA, otros rangos, labels permutados o una base aleatoria. Que tres componentes resuman cinco vectores construidos con etiquetas sintéticas relacionadas no demuestra que la personalidad ocupe un subespacio psicológico intrínseco ni que la geometría sea causal, estable o generalizable. El artículo también dice soportar composición multi-rasgo, pero los experimentos puntúan cada rasgo de forma individual.

La evidencia de preservación de calidad es especialmente débil. El apéndice publica un FLUENCY_TEMPLATE que pide evaluar cuánto refleja la respuesta el rasgo OCEAN y reutiliza sus factores; no define gramática, coherencia, naturalidad o relevancia. Sin código, no puede saberse si las tablas usaron otro prompt, pero el instrumento publicado no valida fluidez. Además, la “varianza” de la Tabla 1 se calcula explícitamente entre las tres condiciones High/Base/Low, no entre ejecuciones, y por eso no mide estabilidad; aun así el texto la interpreta como consistencia entre runs. α se selecciona usando ese mismo umbral de evaluación, de modo que la preservación de fluidez también está condicionada por selección.

Las tablas de conocimiento contradicen “sin impacto”. En Llama, algunas condiciones reducen MMLU 2,21 puntos y ARC 6; en Ministral-8B, las caídas llegan a 5,42 y 9; en Gemma, a 3,90 y 6. No se evalúan capacidades en Mistral-24B o Qwen. La Tabla 4 de Ministral contiene deltas aritméticamente inconsistentes: por ejemplo, 72,02 a 67,50 equivale a −4,52 puntos, no −5,05. Los 11 temas de MMLU no se identifican, no se explica la agregación, y ARC se limita a 500 preguntas. Tampoco se evalúan toxicidad, sesgo, desinformación, seguimiento de instrucciones o seguridad, aunque manipular activaciones puede afectar esos comportamientos.

En suma, el artículo aporta una arquitectura plausible y evidencia descriptiva de que direcciones construidas con Big5-Chat pueden polarizar texto de cinco modelos bajo un juez afín a esas mismas etiquetas. No demuestra todavía steering robusto, interpretable o seguro: faltan código, artefactos, tamaños de evaluación, juez versionado, baselines ejecutados en el mismo protocolo, validación humana, tests, repeticiones y evaluación fuera de distribución. El resultado debe presentarse como control experimental de expresión textual High/Low, no como manipulación validada de personalidad ni como sistema listo para personalización real.

English

This EACL 2026 long paper proposes Activation-Space Personality Steering, an activation intervention designed to shift textual expression along five OCEAN labels without changing model weights. This review uses the definitive ACL Anthology version rather than the 2025 arXiv record and visually inspects all 16 pages. The method produces visible High–Low separations in the published scores, but the evidence does not support several broader abstract claims about a shared psychological subspace, stability, interpretability, or no impact on capabilities.

For each trait, the study takes High/Low Big5-Chat examples, extracts the last non-padding residual state at each layer, computes normalized mean differences, and aggregates layers using non-negative weights whose learning procedure is not specified. The five aggregated vectors are projected through PCA onto three components. One offline layer per trait is selected by combining L2 change, KL, and token-flip diagnostics; a dynamic layer per prompt maximizes logit change. The intervention mixes both layers with heuristic 0.8/0.2 weights, calibrates polarity using labeled prompts, and injects a scaled direction at every decoding step. Intensity α is empirically swept from 4 to 12 and selected so that a purported fluency score remains at least 3.5.

Llama-3-8B-Instruct, Ministral-8B-Instruct-2410, Mistral-Small-24B-Instruct-2501, Qwen2.5-14B-Instruct, and Gemma-3-4B-IT are evaluated at temperature 0.4, top-p 0.95, top-k 50, and repetition penalty 1.1. An unidentified GPT judge rates trait and “fluency” on BFI-style questions and SocialIQA-derived scenarios; judge model, prompt count, repetitions, uncertainty, human agreement, and statistical tests are not reported. High–Low differences derived from Table 1 range from 1.0 to 3.5 points on a 1–5 scale. Llama averages 2.64; in the reported ablation, hybrid exceeds offline-only and dynamic-only, 2.64 versus 1.47 and 0.98. This establishes control over the judge criterion for those prompts, not acquisition of a stable human personality.

The low-dimensionality validation has only five vector-observations per model, one per trait. Three components explain 96.31% for Llama, 96.35% for Ministral-8B, 95.91% for Mistral-24B, and 93.37% for Qwen. The published result is therefore above 90%, not above 95% for every model; Gemma is omitted. There is no comparison with unprojected vectors, other ranks, shuffled labels, or a random basis. That three components summarize five related vectors built from synthetic labels does not establish that personality occupies an intrinsic psychological subspace or that the geometry is causal, stable, or generalizable. The paper also claims multi-trait composition, but experiments score each trait separately.

Quality-retention evidence is particularly weak. The appendix publishes a FLUENCY_TEMPLATE that asks how strongly a response reflects the OCEAN trait and reuses its trait factors; it does not define grammar, coherence, naturalness, or relevance. Without code, it is impossible to know whether the tables used a different prompt, but the published instrument does not validate fluency. Table 1 explicitly computes “variance” across the three High/Base/Low conditions, not across runs, so it cannot measure stability; the narrative nevertheless interprets it as consistency across multiple runs. α is selected using the same evaluation threshold, making fluency preservation partly selection-conditioned.

Knowledge tables contradict “without impact.” Some Llama conditions reduce MMLU by 2.21 points and ARC by 6; Ministral-8B drops by up to 5.42 and 9; Gemma by up to 3.90 and 6. Mistral-24B and Qwen receive no capability evaluation. Ministral Table 4 contains arithmetic inconsistencies: for example, 72.02 to 67.50 is −4.52 points, not −5.05. The 11 MMLU topics are unnamed, aggregation is unspecified, and ARC is limited to 500 questions. Toxicity, bias, misinformation, instruction following, and safety are not tested even though activation manipulation can affect those behaviors.

Overall, the paper offers a plausible architecture and descriptive evidence that directions constructed from Big5-Chat can polarize text from five models under a judge aligned to the same labels. It does not yet establish robust, interpretable, or safe steering: code, artifacts, evaluation sizes, a versioned judge, same-protocol baselines, human validation, statistical tests, repetitions, and out-of-distribution evaluation are missing. The result should be presented as experimental control of High/Low textual expression, not validated personality manipulation or a deployment-ready personalization system.

Pregunta de investigación

¿Puede una dirección de activación High–Low derivada de Big5-Chat, comprimida con PCA e inyectada en una combinación de capa offline y capa dinámica, desplazar la expresión textual de cada rasgo OCEAN en varios LLM abiertos sin degradar fluidez o capacidad general?

Método

Se extraen estados residuales finales por capa de ejemplos sintéticos High/Low de Big5-Chat y se forman diferencias normalizadas por rasgo. Se agregan capas con pesos no negativos no especificados, se proyectan cinco vectores sobre tres componentes PCA y se calibran polaridad e intensidad. Una capa offline se selecciona con L2, KL y token flip; otra dinámica con cambio de logits por prompt; ambas se inyectan con mezcla 0,8/0,2. Cinco modelos se evalúan con preguntas tipo BFI y escenarios SocialIQA mediante un juez GPT no identificado; tres modelos se prueban en subconjuntos de MMLU y ARC. Se compara hybrid con offline-only y dynamic-only mediante diferencias descriptivas de puntuación.

Muestra: No hay participantes humanos. Las unidades de construcción son diálogos sintéticos Big5-Chat etiquetados High/Low; el dataset público tiene 100.000 filas, pero el subconjunto realmente usado no queda determinado por los conteos contradictorios del método. Las unidades de evaluación son prompts tipo cuestionario y escenarios derivados de SocialIQA cuyo número no se informa. Las pruebas de capacidad usan validación de 11 temas MMLU no identificados y 500 preguntas ARC. No se indica número de generaciones, seeds o repeticiones.

Hallazgos

  • La versión definitiva es un artículo largo de EACL 2026, páginas 6388–6403, DOI 10.18653/v1/2026.eacl-long.300.
  • El registro canónico antiguo tenía 2025 por la prepublicación; la publicación definitiva es de marzo de 2026.
  • Big5-Chat público contiene 100.000 filas: 20.000 por rasgo y 10.000 por cada nivel High/Low.
  • El paper no permite identificar su subconjunto: dice 20.000 instancias y también 5.000 por nivel para cada uno de cinco rasgos.
  • El método construye direcciones por diferencia de medias High–Low y no aprende una representación de personalidad a partir de medidas humanas continuas.
  • La capa offline y la dinámica se mezclan con pesos heurísticos 0,8/0,2.
  • El apéndice informa que una contribución dinámica superior a 30% redujo steering y capacidad, pero no publica la curva o todos los ensayos.
  • α se selecciona empíricamente entre 4 y 12 usando un umbral de puntuación de al menos 3,5.
  • Los tres primeros PC explican 96,31%, 96,35%, 95,91% y 93,37% en los cuatro modelos de la Tabla 2.
  • Qwen contradice la afirmación de más de 95% de varianza retenida; el resultado común es solo superior a 90%.
  • Gemma se evalúa en generación pero se omite de la tabla PCA.
  • PCA se ajusta a una matriz formada por solo cinco vectores agregados, uno por etiqueta OCEAN.
  • No se muestra que PCA mejore steering frente a las direcciones originales ni se evalúan otros rangos.
  • Las separaciones High–Low de la Tabla 8 abarcan 1,0–3,5 puntos en una escala de juez 1–5.
  • Llama obtiene separaciones 1,2/2,8/3,0/3,2/3,0 para O/C/E/A/N.
  • Ministral-8B obtiene 2,4/2,0/2,8/3,3/1,0.
  • Mistral-24B obtiene 1,8/1,9/3,5/2,6/2,8.
  • Qwen-14B obtiene 1,9/2,9/2,6/1,9/2,7.
  • Gemma-3-4B obtiene 2,8/2,3/3,5/2,7/2,7.
  • En la ablación Llama, hybrid promedia 2,64 frente a 1,47 offline-only y 0,98 dynamic-only.
  • En la ablación Gemma, hybrid promedia 2,8 frente a 2,06 y 1,8.
  • No se publican tests que respalden el uso de significativamente para esas diferencias.
  • La comparación con prompt, SFT y DPO toma números de otro trabajo y otro método de scoring, no ejecuciones controladas en este estudio.
  • El prompt de fluidez publicado evalúa reflejo del rasgo y no contiene criterios de fluidez lingüística.
  • La varianza de la Tabla 1 se calcula entre High/Base/Low y no entre repeticiones.
  • El texto interpreta indebidamente esa varianza entre condiciones como estabilidad entre múltiples runs.
  • Las condiciones de Llama pierden hasta 2,21 puntos MMLU y 6 ARC.
  • Las condiciones de Ministral-8B pierden hasta 5,42 puntos MMLU y 9 ARC.
  • Las condiciones de Gemma pierden hasta 3,90 puntos MMLU y 6 ARC.
  • Mistral-24B y Qwen no reciben evaluación de retención de capacidad.
  • La Tabla 4 contiene deltas inconsistentes con sus accuracies; 72,02 a 67,50 es −4,52, no −5,05.
  • No se libera el modelo GPT usado como juez, por lo que las puntuaciones no son reproducibles ni comparables en el tiempo.
  • Los ejemplos muestran polarización estilística clara, incluida caricaturización del polo Low de Conscientiousness.
  • La dirección High de Neuroticism se llama positive steering aunque semánticamente no significa un resultado deseable.
  • La geometría revela dependencias entre direcciones; el propio apéndice dice que ortogonalizarlas reduce sustancialmente el efecto.
  • El trabajo evalúa cada rasgo por separado y no demuestra composición simultánea de los cinco rasgos.
  • No se encontró repositorio de código o artefactos enlazado desde la publicación definitiva o mediante búsquedas exactas.

Limitaciones

  • Big5-Chat es sintético y sus niveles High/Low proceden de condicionamiento textual, no de participantes con puntuaciones psicométricas medidas.
  • La dirección puede capturar frases, estereotipos y plantillas del generador de Big5-Chat más que un rasgo psicológico.
  • No se evalúa contaminación entre escenarios Big5-Chat y prompts de evaluación derivados de SocialIQA/SODA.
  • Los conteos del subconjunto de activaciones son incompatibles y no hay índices, split o seed de muestreo.
  • No se separa un conjunto de entrenamiento de direcciones, calibración de polaridad, selección de α y evaluación final de forma verificable.
  • El aprendizaje de los pesos no negativos por capa se afirma pero no se define con objetivo, algoritmo o hiperparámetros.
  • No se publican valores de los pesos lambda que combinan L2, KL y flip en la selección offline.
  • No se informa el número ni contenido de prompts neutrales usados en la selección offline.
  • No se informa el tamaño de Pcal ni el procedimiento humano de verificación semántica de polaridad.
  • El paper dice human validation para α sin describir participantes, jueces, protocolo, acuerdo o aprobación ética.
  • La capa dinámica se elige por máximo cambio de logits, una medida de sensibilidad que no garantiza dirección semántica correcta.
  • Maximizar cambio puede seleccionar capas que alteran mucho el output por razones ajenas al rasgo.
  • La mezcla 0,8/0,2 es heurística y se selecciona con los mismos resultados que luego se presentan como ablación.
  • La afirmación de reproducibilidad por absolute scaling ignora diferencias de norma, arquitectura y prompt que el propio texto reconoce.
  • No se informa coste de ejecutar diagnósticos por capa y forward hooks en cada paso de decodificación.
  • El rango PCA se fija en tres sin análisis de sensibilidad o validación fuera de muestra.
  • Con cinco vectores de entrada, cualquier análisis de rango está severamente limitado y no estima una población de rasgos.
  • No se centran o documentan en detalle las convenciones PCA, pese a interpretar porcentajes como estructura psicológica.
  • Qwen queda por debajo del umbral >95% afirmado en contribuciones y conclusión.
  • Gemma falta en el análisis PCA y la Tabla 9 no identifica de qué modelo procede la geometría mostrada.
  • La similitud entre vectores no valida correspondencia con relaciones Big Five humanas.
  • No hay labels permutados, dataset alternativo, control de estilo o direcciones aleatorias como controles negativos.
  • No se compara no-PCA con PCA ni se cuantifica qué señal se pierde al proyectar.
  • La ortogonalización selectiva se describe en apéndice pero no se formaliza ni se integra claramente en las ecuaciones del método.
  • No se evalúa steering multi-rasgo simultáneo pese a afirmarlo como ventaja.
  • El número de preguntas BFI y escenarios SocialIQA no se informa.
  • No se publican prompts individuales completos salvo pocos ejemplos.
  • No se informa cuántas generaciones se producen por prompt, condición, rasgo y modelo.
  • No se fijan seeds ni se reporta variabilidad de sampling con temperatura 0,4.
  • El juez GPT no tiene nombre de modelo, snapshot, proveedor, parámetros, prompt de sistema o repetición.
  • No se evalúa sesgo posicional, autoconsistencia o sensibilidad del juez.
  • No hay evaluación humana independiente de trait scores o fluidez.
  • El FLUENCY_TEMPLATE publicado no pregunta por fluidez; vuelve a preguntar por personalidad.
  • El criterio de fluidez usado para calibrar α es por tanto inválido o, si el código difería, no está documentado.
  • La evaluación y la calibración comparten juez y umbral, favoreciendo resultados que pasan el criterio seleccionado.
  • La varianza entre High/Base/Low mide dispersión del efecto y no estabilidad temporal o entre runs.
  • No hay desviaciones estándar por repetición, intervalos, barras definidas, bootstrap o tests.
  • El término significantly se usa sin hipótesis, estadístico, p-value, intervalo o corrección múltiple.
  • No se prueba equivalencia o no inferioridad de fluidez/capacidad frente al baseline.
  • Las comparaciones externas con prompt/SFT/DPO usan protocolos de scoring distintos.
  • La dirección High–Low puede aumentar extremos y caricaturas sin conservar naturalidad o utilidad.
  • Los ejemplos negativos incluyen conductas desorganizadas, hostiles o ansiosas estereotipadas, no una medición matizada del rasgo.
  • No se evalúa contenido factual, relevancia, longitud, diversidad léxica, repetición o preferencia humana.
  • MMLU se describe citando MMLU-Pro pero el recurso enlazado y el nombre usado son MMLU; la variante exacta es ambigua.
  • No se enumeran los 11 temas MMLU ni el método de agregación.
  • ARC usa solo 500 preguntas y no se informa selección, seed o si son todos los ítems disponibles.
  • Las accuracies no tienen intervalos y algunas diferencias pueden ser ruido muestral.
  • La Tabla 4 contiene errores aritméticos en los deltas frente al baseline.
  • Las caídas de hasta 9 puntos ARC son materiales aunque el texto las llame minor variation.
  • Solo tres de cinco modelos reciben pruebas de capacidad.
  • No hay benchmarks de instruction following, seguridad, toxicidad, sesgo, verdad o privacidad.
  • No se prueba generalización a otros idiomas, dominios, culturas, longitudes o tipos de diálogo.
  • No se prueba estabilidad ante paráfrasis, adversarios, jailbreaks, system prompts o conversaciones multi-turn.
  • No se publica código, vectores, configuraciones, outputs ni resultados por ejemplo.
  • Sin artefactos no puede verificarse si el prompt de fluidez del apéndice coincide con la ejecución real.
  • No hay evaluación del coste de memoria/latencia ni compatibilidad con serving optimizado.
  • Las intervenciones requieren acceso a activaciones y no se aplican a APIs cerradas.
  • La validez del Big Five en humanos no transfiere automáticamente validez psicométrica a scores de texto generado por LLM.
  • No se estudia impacto del steering sobre usuarios, persuasión, confianza o antropomorfismo.
  • No se implementan los filtros, moderación o políticas recomendados en la sección ética.
  • La financiación de defensa se declara, pero no se discuten casos de uso duales específicos más allá de advertencias generales.

Qué no demuestra

  • No establece que un LLM posea o adquiera personalidad humana.
  • No demuestra que las direcciones representen constructos Big Five psicométricamente válidos.
  • No demuestra que la personalidad ocupe intrínsecamente un subespacio de tres dimensiones.
  • No demuestra más de 95% de varianza retenida en todos los modelos.
  • No demuestra que PCA sea necesario o mejor que usar direcciones sin proyectar.
  • No demuestra composición simultánea robusta de múltiples rasgos.
  • No demuestra interpretabilidad causal de capas, vectores o cambios de logits.
  • No demuestra estabilidad entre ejecuciones con la varianza publicada.
  • No demuestra preservación de fluidez con el prompt publicado.
  • No demuestra ausencia de degradación de capacidad general.
  • No demuestra superioridad frente a prompting, SFT o DPO bajo un protocolo común.
  • No demuestra generalización a modelos fuera de las cinco arquitecturas, especialmente APIs cerradas.
  • No demuestra seguridad, fairness, ausencia de toxicidad o resistencia a uso malicioso.
  • No demuestra robustez a dominios, culturas, idiomas, prompts o conversaciones reales.
  • No ofrece un sistema reproducible o listo para producción sin código, artefactos y evaluación validada.

Trazabilidad

Alcance: Texto completo

Versión: EACL 2026 long paper, ACL Anthology 2026.eacl-long.300, DOI 10.18653/v1/2026.eacl-long.300, pages 6388–6403; 16 pages; arXiv:2511.03738v2 retained as superseded source

Fuente consultada: https://aclanthology.org/2026.eacl-long.300.pdf

Revisión: Codex definitive-version reconciliation, complete bilingual full-text fidelity pass, all-page PDF visual inspection, Hugging Face Dataset Viewer verification, table arithmetic audit, evaluator-prompt audit, construct-validity and capability-retention review; summaries written from the full paper and source data rather than abstract keywords, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Llama-3-8B-Instruct as primary steering model; exact repository identifier not stated
  • mistralai/Ministral-8B-Instruct-2410
  • mistralai/Mistral-Small-24B-Instruct-2501, labeled Ministral-24B in tables
  • Qwen/Qwen2.5-14B-Instruct
  • google/gemma-3-4b-it
  • Unidentified GPT-based evaluation model used as trait and purported fluency judge

Instrumentos y métricas

  • Last non-padding residual-state extraction by decoder layer
  • Normalized High-minus-Low mean activation directions
  • Unspecified non-negative trait-specific layer weights summing to one
  • Rank-three PCA projection over five aggregated trait vectors
  • Offline layer score combining L2 probability shift, KL divergence and argmax token flip rate
  • Dynamic layer selection by steered-versus-base logit L2 norm
  • Heuristic 0.8 offline and 0.2 dynamic layer mixture
  • Polarity calibration by KL followed by semantic prompt checks
  • Global steering gain 8.0 and per-trait alpha values from 4 to 12
  • GPT-based 1–5 trait judge prompt
  • Published FLUENCY_TEMPLATE that actually asks for trait reflection rather than fluency
  • MMLU over validation sets of 11 unnamed topics
  • ARC-Challenge over 500 questions
  • Descriptive High–Low trait separation and baseline-referenced score changes without inferential tests

Datos utilizados

  • wenkai-li/big5_chat: official Hugging Face train split has 100,000 synthetic dialogues, 20,000 per trait and 10,000 per High/Low level
  • Unspecified subset of Big5-Chat; paper simultaneously reports 20,000 instances and 5,000 per High/Low level for each trait
  • Unspecified set of Big Five Inventory-style interview questions
  • Unspecified number of situational questions constructed from SocialIQA
  • MMLU validation subsets for 11 unnamed topics
  • ARC-Challenge subset of 500 questions
  • No released code, activation vectors, prompt list, generated outputs, judge outputs, seeds or result tables located

Evidencia y localización

  • Publicación definitiva, año, venue, DOI y páginas: ACL Anthology record 2026.eacl-long.300 and definitive PDF page 1
  • Extracción, agregación y PCA de direcciones: Definitive paper Sections 3.2–3.3, page 4
  • Selección offline, dinámica y mezcla 0.8/0.2: Definitive paper Section 3.4, page 5
  • Polaridad, ganancia e intensidad: Definitive paper Sections 3.5–3.6 and 5, pages 6–7
  • Big5-Chat real: 100k, 20k por rasgo y 10k por nivel: Hugging Face Dataset Viewer API /size and /statistics for wenkai-li/big5_chat on 15 July 2026
  • Conteos contradictorios del subconjunto Big5-Chat: Definitive paper Section 3.2, page 4
  • Modelos y decoding: Definitive paper Results, page 7
  • Varianza PCA exacta y Qwen 93.37%: Definitive paper Table 2, page 7
  • Trait scores, fluency scores y varianza entre condiciones: Definitive paper Table 1 and Section 5.2, pages 7–8
  • Ablaciones hybrid/offline/dynamic: Definitive paper Figure 4 and Appendix Tables 6–7, pages 9 and 14
  • Diferencias High–Low y shifts de supuesta fluidez: Definitive paper Appendix Table 8, page 15
  • Caídas de MMLU y ARC y deltas aritméticos: Definitive paper Tables 3–5, pages 8 and 14; independent subtraction from displayed base accuracies
  • Prompt de fluidez que vuelve a evaluar el rasgo: Definitive paper Appendix I FLUENCY_TEMPLATE, page 16
  • Limitaciones y ética declaradas: Definitive paper Limitations and Ethical Considerations, pages 9–10
  • Ausencia de código o artefactos enlazados: Definitive paper, ACL Anthology record and exact-title/code repository searches checked 15 July 2026
  • Inspección visual: All 16 pages of the definitive EACL 2026 PDF rendered and visually inspected on 15 July 2026