PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs

Evaluación y validez psicométrica2026arXivRevisión editorial aprobada

Autores: Tianyu Zhao, Siqi Li, Yasser Shoukry, Salma Elmalaki

Palabras clave: Large Language Models, Personality, Persona, AI Safety

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

4
Autores
7
Hallazgos
31
Limitaciones
13
Evidencias

Resumen editorial

Español

PACIFIC es un benchmark sintético de elección múltiple para estudiar si organizar preferencias por etiquetas Big Five ayuda a un LLM a elegir una opción coherente; no es una colección de preferencias humanas observadas ni una prueba psicométrica. Gemini 2.5 Pro genera 1.200 triples de preferencia, pregunta y cuatro opciones en 20 temas y diez direcciones de rasgo, alto/bajo para O, C, E, A y N. Otro LLM, GPT-4o-mini, puntúa cada texto de 1 a 7 por rasgo y asigna confianza. Un filtro a 0,7 deja 803 preferencias candidatas; los experimentos principales toman 200 preguntas balanceadas, 20 por dirección.

En Gemma-3-4B-IT, la Tabla 1 informa 25,75 % sin preferencias, 29,25 % con cinco preferencias mezcladas, 63 % con cinco preferencias del rasgo correcto y 61,75 % al añadir dos distractores. Etiquetar con el rasgo verdadero solo las preferencias eleva el resultado a 76 %, mientras un recordatorio sin etiquetas da 67 %. Etiquetar también las opciones baja a 57,25 % y usar solo etiquetas a 37,75 %, con colapso en varios rasgos bajos. Llama-3-8B-Instruct alcanza 88,75 % con preferencias alineadas; Gemini-2.5-Pro 99,25 % y GPT-4o-mini 97,5 %, casi techo en un corpus generado para hacer visible la misma regla.

El titular 29,25→76 % mezcla dos intervenciones: seleccionar preferencias mediante etiquetas verdaderas eleva Gemma a 63 %, y añadir esas etiquetas oracle al prompt lo eleva después a 76 %. No es el resultado del sistema automático. Cuando no se dispone de etiquetas, el DPR preentrenado obtiene 30,25 % y el retriever ajustado contrastivamente 43 %. Tampoco se infiere bien la personalidad de extremo a extremo: Gemma alcanza 54,5 % desde preferencias, con 95–100 % en rasgos altos y solo 0–40 % en rasgos bajos; desde opciones llega a 85,69 %. El paper atribuye la asimetría a sesgo de deseabilidad social inducido por RLHF, pero el diseño no compara un modelo base con uno RLHF ni descarta artefactos del prompt o del corpus, por lo que es una hipótesis, no una causa demostrada.

La validación humana reúne 15 participantes con una prueba de personalidad no identificada y 25 casos dirigidos a sus rasgos dominantes. Se informa 78,22 % de acierto, Fleiss κ=0,8599, Cohen κ=0,9170 entre GPT-4o-mini y el consenso, y 67,11 % de resonancia personal. Faltan instrumento, distribución de participantes y casos, instrucciones completas, reclutamiento, compensación, intervalos, comparación con rasgos no coincidentes y revisión ética. Una tasa de aprobación del 67,11 % no es una correlación psicométrica.

La auditoría del artefacto oficial en Hugging Face, commit dee6c7144ca0efa1132eebfdd538ecbde610b927, encuentra 1.200 filas en un único split train: exactamente 120 por dirección de rasgo y 60 por tema, aunque el paper afirma no imponer distribuciones uniformes. En todas las filas ground_truth_choice_id es 0 porque el prompt de generación exige colocar primero la respuesta correcta. No se documenta barajado; que los resultados publicados no sean 100 % implica un preprocesado no descrito o un protocolo distinto que no puede verificarse. El dataset no incluye las conversaciones de 2–4 turnos que el paper dice añadir; la ficha avisa que llegarán después. Tampoco hay código, IDs de la muestra de 200, split de ajuste/evaluación del retriever, respuestas de modelos o resultados ejecutables. PACIFIC es útil para revelar cómo etiquetas OCEAN construidas pueden organizar contexto, pero la evidencia mide consistencia con una taxonomía sintética y no preferencias reales de personas.

English

PACIFIC is a synthetic multiple-choice benchmark for testing whether organizing preferences by Big Five labels helps an LLM choose a congruent option; it is neither a collection of observed human preferences nor a psychometric test. Gemini 2.5 Pro generates 1,200 preference-question-four-choice triples across 20 topics and ten trait directions, high/low O, C, E, A, and N. Another LLM, GPT-4o-mini, scores every text from 1 to 7 per trait and assigns confidence. A .7 filter leaves 803 candidate preferences; the main experiments use 200 balanced questions, 20 per direction.

For Gemma-3-4B-IT, Table 1 reports 25.75% without preferences, 29.25% with five mixed preferences, 63% with five preferences from the correct trait, and 61.75% after adding two distractors. Adding ground-truth labels to the preferences reaches 76%, while an unlabeled reminder reaches 67%. Labeling choices as well drops to 57.25%, and labels without text to 37.75%, with collapse on several low traits. Llama-3-8B-Instruct reaches 88.75% with aligned preferences; Gemini-2.5-Pro reaches 99.25% and GPT-4o-mini 97.5%, near ceiling on a corpus generated to expose the same rule.

The 29.25→76% headline combines two interventions: ground-truth selection of aligned raw preferences raises Gemma to 63%, then adding oracle labels raises it to 76%. This is not the automatic system's result. Without labels, pretrained DPR scores 30.25% and the contrastively fine-tuned retriever 43%. End-to-end personality inference is also weak: Gemma reaches 54.5% from preferences, with 95–100% on high traits but only 0–40% on low traits; prediction from choices reaches 85.69%. The paper attributes this asymmetry to RLHF-induced social-desirability bias, but it does not compare a base and RLHF model or eliminate prompt and dataset artifacts, so the causal attribution remains a hypothesis.

The human check has 15 participants complete an unnamed personality assessment and evaluate 25 cases routed to their dominant traits. It reports 78.22% accuracy, Fleiss' κ=.8599, Cohen's κ=.9170 between GPT-4o-mini and consensus, and 67.11% personal resonance. The instrument, allocation of people and items, full instructions, recruitment, compensation, uncertainty, mismatched-trait control, and ethics review are absent. A 67.11% approval rate is not a psychometric correlation.

The official Hugging Face artifact at commit dee6c7144ca0efa1132eebfdd538ecbde610b927 has 1,200 rows in one train split: exactly 120 per trait direction and 60 per topic, despite the paper's claim that it does not impose uniform distributions. Every row has ground_truth_choice_id=0 because the generation prompt requires the correct response first. No shuffling is documented; the non-100% reported scores therefore require an undisclosed preprocessing step or a different protocol that cannot be checked. The release also lacks the 2–4-turn conversations the paper says it adds; its card says they will come later. No code, 200-item sample IDs, retriever train/evaluation split, model outputs, or runnable results are public. PACIFIC is useful for showing how constructed OCEAN labels can organize context, but its evidence measures consistency with a synthetic taxonomy rather than real people's preferences.

Pregunta de investigación

¿Ayuda agrupar, etiquetar o recuperar preferencias sintéticas por direcciones Big Five a que distintos LLM seleccionen la opción de respuesta definida como coherente con el mismo rasgo, incluso cuando la preferencia exacta no aparece en la pregunta?

Método

Gemini 2.5 Pro genera preferencias, preguntas y cuatro respuestas según diez direcciones OCEAN y 20 temas. GPT-4o-mini puntúa rasgos y confianza; un filtro conserva pares de alta confianza. Se comparan, sobre 200 preguntas balanceadas, ausencia de preferencias, preferencias mezcladas, alineadas, contaminadas, etiquetas ground-truth, recordatorio y RAG con DPR. Se evalúan Gemma-3-4B-IT, Llama-3-8B-Instruct, Gemini-2.5-Pro y GPT-4o-mini mediante accuracy. Un estudio pequeño compara opciones y preferencias sintéticas con participantes de rasgos supuestamente coincidentes.

Muestra: El release contiene 1.200 filas en inglés, 120 por cada una de las diez direcciones OCEAN y 60 por cada uno de 20 temas. El filtro τ=0,7 produce 803 preferencias según el paper. Cada evaluación principal dice muestrear 200 preguntas: dos por dirección repetidas diez veces, con cinco preferencias por pregunta salvo indicación contraria. La validación humana usa 15 participantes y 25 instancias, sin desglose suficiente para reconstruir asignaciones o denominadores.

Hallazgos

  • Para Gemma, cinco preferencias alineadas por etiqueta verdadera elevan accuracy de 29,25 % con preferencias mezcladas a 63 %; añadir la etiqueta ground-truth de las preferencias llega a 76 %.
  • Un recordatorio sin etiquetas alcanza 67 % en Gemma. Etiquetar preferencias y opciones baja a 57,25 %, y proporcionar solo etiquetas baja a 37,75 %, con fuerte asimetría contra rasgos Low.
  • Llama alcanza 88,75 %, Gemini 99,25 % y GPT-4o-mini 97,5 % con preferencias alineadas; los dos modelos cerrados están casi en techo, compatible con abundantes señales textuales del rasgo generado.
  • El sistema automático sin etiquetas queda muy por debajo del oracle: DPR preentrenado 30,25 % y DPR ajustado 43 % en PACIFIC. El paper denomina a estos valores accuracy de retrieval, pero la tabla mide la respuesta final por rasgo.
  • La predicción de rasgos desde preferencias obtiene 54,5 %: los cinco rasgos High están entre 95 % y 100 %, mientras Low queda entre 0 % y 40 %. Desde las opciones alcanza 85,69 %.
  • La validación humana reporta 78,22 % de acierto y 67,11 % de resonancia, con κ elevados; la documentación disponible no permite auditar cómo se calcularon ni interpretar 67,11 % como correlación.
  • El artefacto publicado fija la respuesta correcta en la primera posición en las 1.200 filas y está exactamente balanceado. Sin código o barajado documentado, el benchmark liberado tiene un atajo posicional determinista.

Limitaciones

  • Todas las preferencias, preguntas, opciones, explicaciones y primeras etiquetas proceden de LLM. El benchmark comprueba en gran medida coherencia con reglas que el generador recibió explícitamente.
  • El generador recibe una dirección OCEAN y debe crear una respuesta adherente primero y tres violaciones después. La construcción favorece marcadores léxicos evidentes y separación artificial de opciones.
  • En el release, ground_truth_choice_id=0 para las 1.200 filas. No se documenta barajado de opciones, semilla o mapa entre orden publicado y orden evaluado.
  • La distribución publicada es exactamente uniforme: 120 filas por dirección de rasgo y 60 por tema. Esto contradice la afirmación de cubrir el espectro sin imponer distribuciones uniformes.
  • El paper alterna entre 1.200 pares curados, 803 preferencias tras τ=0,7 y muestras de 200 sin publicar los IDs exactos ni una bandera del subconjunto evaluado.
  • Solo existe un split train. No se describe cómo se separan los datos usados para ajustar DPR de las 200 preguntas de evaluación; no puede excluirse solapamiento o fuga.
  • El dataset publicado no contiene el contexto de escenario ni los diálogos de 2–4 turnos descritos en el paper. La propia ficha indica que las conversaciones completas llegarán más adelante.
  • El titular 29,25→76 % no aísla selección por personalidad: 63 % corresponde a seleccionar texto alineado y 76 % a añadir etiquetas verdaderas al prompt.
  • La personalidad del usuario no está inferida en la condición de 76 %; el experimento asume etiquetas ground-truth de pregunta y preferencias, inaccesibles en despliegue normal.
  • El método automático propuesto alcanza 43 %, no 76 %, y carece de medida directa de calidad de recuperación como recall@k, precision@k o nDCG.
  • El end-to-end de rasgos falla casi por completo en varias categorías Low. Por tanto, el cuello de botella real contradice la presentación de personalidad inferida como señal fiable.
  • La atribución del fallo Low a RLHF y deseabilidad social es post hoc. No hay comparación base/instruction, ablación de RLHF, reformulación neutral o experimento causal.
  • La taxonomía hardcodea asociaciones discutibles: alta neuroticidad con seguridad, baja con eficiencia y tolerancia al riesgo; baja amabilidad, apertura o responsabilidad pueden recibir descripciones normativas o estereotipadas.
  • Decir que el dataset formaliza un nexo causal entre personalidad y preferencia confunde una regla impuesta durante generación con evidencia causal sobre personas.
  • Los 32 perfiles son combinaciones factoriales High/Low, no individuos medidos. La Figura 4 analiza personas sintéticas construidas, no diversidad humana observada.
  • La validación humana usa solo 15 participantes y 25 instancias dirigidas a sus rasgos dominantes, lo que puede elevar acuerdo. No hay condición de rasgo no coincidente o preferencias humanas reales.
  • No se identifica el cuestionario de personalidad, sus escalas o puntos de corte, ni se publican demografía, reclutamiento, compensación, consentimiento, aprobación ética o datos de anotación.
  • El 67,11 % de resonancia es una proporción de aprobación, no una correlación entre personalidad medida y preferencia. No se informa baseline, intervalo o contraste.
  • GPT-4o-mini reduce el sesgo de usar exactamente el generador Gemini como evaluador, pero sigue siendo una anotación automática basada en la misma definición y prompts OCEAN.
  • Las palabras “significantly” y “confirms” no van acompañadas de tests, intervalos, repeticiones de inferencia o corrección múltiple.
  • El protocolo dice 20 observaciones por dirección, pero las precisiones por rasgo cambian en pasos de 2,5 puntos y los promedios globales en 0,25; falta explicar la agregación o ejecuciones adicionales.
  • No se reportan temperatura, top-p, semillas, fechas de API, snapshots fechados de Gemini/GPT, reintentos o variabilidad. Los modelos cerrados pueden cambiar.
  • El ajuste DPR informa algunos hiperparámetros, pero no checkpoint exacto, top-k, construcción completa de negativos, split, criterio de convergencia, semilla o métrica de validación.
  • La réplica PrefEval usa etiquetas derivadas y carece de varias direcciones de rasgo; no es un control psicométrico independiente. Sus resultados tampoco muestran que añadir etiquetas mejore sobre preferencias sin etiquetar.
  • No hay evaluación de generación libre, diálogo longitudinal, preferencias que cambian, conflicto entre rasgos, utilidad de respuesta, satisfacción o daño; el propio futuro trabajo aplaza generación.
  • El corpus es inglés y usa 20 temas predefinidos. No se demuestra generalización cultural, lingüística o fuera de la taxonomía sintética.
  • Hay dominios de alto riesgo, medicina, seguridad, finanzas, relaciones, donde obedecer una preferencia de riesgo puede ser perjudicial. El impact statement afirma no prever riesgos específicos sin analizarlos.
  • Inferir personalidad desde historial plantea consentimiento, privacidad, perfilado sensible, manipulación y derecho a corregir el perfil. No se proponen controles de usuario, minimización o borrado.
  • El repositorio Hugging Face tiene licencia Apache-2.0 y los datos, pero una ficha mínima sin schema, provenance detallada, intended uses, limitaciones, riesgos, splits o instrucciones reproducibles.
  • El paper promete código, pero no se encontró repositorio oficial. Sin scripts, prompts completos suplementarios, muestras, outputs y logs, no se pueden regenerar las tablas.
  • Las referencias internas son inconsistentes: la sección de setup remite resultados Gemma y estrategias a la Tabla 11, que en el apéndice contiene solo DPR; los resultados principales están en Tablas 1–3.

Qué no demuestra

  • No establece que los rasgos Big Five causen las preferencias sintéticas; esa relación se impone en el prompt de generación.
  • No demuestra que PACIFIC mida personalidad humana real, validez psicométrica o preferencias naturales fuera del corpus construido.
  • No demuestra que un sistema automático alcance 76 %: esa cifra usa selección y etiquetas ground-truth, mientras el RAG sin etiquetas alcanza 43 %.
  • No prueba causalmente que RLHF produzca el fallo en rasgos Low ni que la asimetría sea deseabilidad social en lugar de diseño del prompt o estereotipo de datos.
  • No demuestra que más memoria sea catastrófica en general; solo observa una bajada pequeña con preferencias sintéticas mezcladas en un modelo y protocolo concretos.
  • No valida personalización segura, justa o beneficiosa en medicina, finanzas, seguridad, persuasión o relaciones.
  • No evalúa una personalidad persistente del LLM; perfila al usuario para seleccionar respuestas de opción múltiple.
  • No permite reproducir los resultados publicados desde los artefactos oficiales actuales.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2602.07181v3, submitted 6 February 2026, revised 7 April 2026; preprint under review, 28 pages

Fuente consultada: https://arxiv.org/pdf/2602.07181v3

Revisión: Codex full-text, bilingual-fidelity, 28-page visual, arXiv-v3, under-review-status, Hugging-Face-Dataset-Viewer, Parquet-distribution, synthetic-data, answer-position, psychometric-construct, oracle-label, headline-decomposition, retrieval-split, human-grounding, statistical-claim, social-desirability-causality, safety, privacy and reproducibility audit, 2026-07-15

Aprobación: Codex fidelity pass, 2026-07-15

Modelos evaluados

  • Gemini 2.5 Pro dataset generator and evaluated model
  • GPT-4o-mini dataset evaluator and evaluated model
  • Gemma-3-4B-IT
  • Llama-3-8B-Instruct
  • Dense Passage Retrieval with BERT bi-encoders
  • Contrastively fine-tuned persona-aware DPR

Instrumentos y métricas

  • Synthetic High/Low OCEAN persona directions
  • LLM-assigned 1–7 trait scores and 0–1 confidence
  • High-violation generation constraint
  • Confidence threshold τ=0.7
  • Four-choice preference-alignment accuracy
  • Ground-truth trait label prompting
  • Instruction-only personality reminder
  • Fleiss kappa and Cohen kappa
  • Unnamed participant personality assessment

Datos utilizados

  • PACIFIC, 1,200 released synthetic rows
  • PACIFIC confidence-filtered subset, reported as 803 preferences
  • PACIFIC 200-question balanced experimental sample
  • PrefEval-derived control subset
  • 15-person, 25-instance human grounding sample

Evidencia y localización

  • Metadatos, abstract, alcance y titular: arXiv:2602.07181v3, pp. 1–2, Abstract, Introduction and Contributions
  • Construcción sintética, OCEAN y validación humana: Paper, pp. 3–4, Sections 2.1–2.3
  • Contextos, condiciones y muestreo: Paper, pp. 5–6, Sections 3.1–3.2, Table 1 and Figure 2
  • Oracle labels, reminder y RAG: Paper, pp. 6–8, Sections 3.2–4.2 and Tables 2–3
  • Predicción end-to-end y atribución de sesgo: Paper, pp. 8–9, Section 4.3 and Table 3
  • Memoria, conclusión y alcance real: Paper, pp. 9–10, Discussion and Conclusion
  • Generación, filtro, prompts y PrefEval: Paper, pp. 13–18, Appendices A.1–A.5 and Prompts 1–2
  • Resultados de Llama, Gemini y GPT-4o-mini: Paper, pp. 18–21, Appendix A.7 and Tables 8–10
  • Retriever, perfiles, futuro e impacto: Paper, pp. 22–28, Appendices C–F, Tables 11–12 and Figure 4
  • Inspección visual integral: Paper, all 28 rendered pages, including every figure, table, prompt and appendix page
  • Esquema, filas, splits, licencia y ausencia de conversaciones: Official Hugging Face dataset, commit dee6c7144ca0efa1132eebfdd538ecbde610b927, README.md, PACIFIC.jsonl and Dataset Viewer API
  • Atajo posicional y distribución exacta: Official Hugging Face Dataset Viewer and Parquet query: 1,200/1,200 ground_truth_choice_id=0; 120 rows per trait direction; 60 rows per topic
  • Ausencia de código reproducible: Paper and official arXiv/Hugging Face project surfaces; code release is stated as planned, not present