PACIFIC es un benchmark sintético de elección múltiple para estudiar si organizar preferencias por etiquetas Big Five ayuda a un LLM a elegir una opción coherente; no es una colección de preferencias humanas observadas ni una prueba psicométrica. Gemini 2.5 Pro genera 1.200 triples de preferencia, pregunta y cuatro opciones en 20 temas y diez direcciones de rasgo, alto/bajo para O, C, E, A y N. Otro LLM, GPT-4o-mini, puntúa cada texto de 1 a 7 por rasgo y asigna confianza. Un filtro a 0,7 deja 803 preferencias candidatas; los experimentos principales toman 200 preguntas balanceadas, 20 por dirección.
En Gemma-3-4B-IT, la Tabla 1 informa 25,75 % sin preferencias, 29,25 % con cinco preferencias mezcladas, 63 % con cinco preferencias del rasgo correcto y 61,75 % al añadir dos distractores. Etiquetar con el rasgo verdadero solo las preferencias eleva el resultado a 76 %, mientras un recordatorio sin etiquetas da 67 %. Etiquetar también las opciones baja a 57,25 % y usar solo etiquetas a 37,75 %, con colapso en varios rasgos bajos. Llama-3-8B-Instruct alcanza 88,75 % con preferencias alineadas; Gemini-2.5-Pro 99,25 % y GPT-4o-mini 97,5 %, casi techo en un corpus generado para hacer visible la misma regla.
El titular 29,25→76 % mezcla dos intervenciones: seleccionar preferencias mediante etiquetas verdaderas eleva Gemma a 63 %, y añadir esas etiquetas oracle al prompt lo eleva después a 76 %. No es el resultado del sistema automático. Cuando no se dispone de etiquetas, el DPR preentrenado obtiene 30,25 % y el retriever ajustado contrastivamente 43 %. Tampoco se infiere bien la personalidad de extremo a extremo: Gemma alcanza 54,5 % desde preferencias, con 95–100 % en rasgos altos y solo 0–40 % en rasgos bajos; desde opciones llega a 85,69 %. El paper atribuye la asimetría a sesgo de deseabilidad social inducido por RLHF, pero el diseño no compara un modelo base con uno RLHF ni descarta artefactos del prompt o del corpus, por lo que es una hipótesis, no una causa demostrada.
La validación humana reúne 15 participantes con una prueba de personalidad no identificada y 25 casos dirigidos a sus rasgos dominantes. Se informa 78,22 % de acierto, Fleiss κ=0,8599, Cohen κ=0,9170 entre GPT-4o-mini y el consenso, y 67,11 % de resonancia personal. Faltan instrumento, distribución de participantes y casos, instrucciones completas, reclutamiento, compensación, intervalos, comparación con rasgos no coincidentes y revisión ética. Una tasa de aprobación del 67,11 % no es una correlación psicométrica.
La auditoría del artefacto oficial en Hugging Face, commit dee6c7144ca0efa1132eebfdd538ecbde610b927, encuentra 1.200 filas en un único split train: exactamente 120 por dirección de rasgo y 60 por tema, aunque el paper afirma no imponer distribuciones uniformes. En todas las filas ground_truth_choice_id es 0 porque el prompt de generación exige colocar primero la respuesta correcta. No se documenta barajado; que los resultados publicados no sean 100 % implica un preprocesado no descrito o un protocolo distinto que no puede verificarse. El dataset no incluye las conversaciones de 2–4 turnos que el paper dice añadir; la ficha avisa que llegarán después. Tampoco hay código, IDs de la muestra de 200, split de ajuste/evaluación del retriever, respuestas de modelos o resultados ejecutables. PACIFIC es útil para revelar cómo etiquetas OCEAN construidas pueden organizar contexto, pero la evidencia mide consistencia con una taxonomía sintética y no preferencias reales de personas.