Sah y Lian presentan PerFairX, un marco exploratorio para comparar personalización por rasgos OCEAN y disparidad demográfica en recomendaciones generadas por LLM. El estudio infiere perfiles de personalidad a partir de preferencias de género, selecciona cinco usuarios de MovieLens 10M y cinco de Last.fm 360K, y solicita a ChatGPT y DeepSeek listas top-15 con un prompt genérico y otro sensible a la personalidad. Define diez métricas, aunque solo informa ocho en la comparación final y las agrega con pesos iguales. DeepSeek aumenta su Personality Alignment Score de 0,280 a 0,848 en MovieLens y de 0,315 a 0,872 en Last.fm; ChatGPT, en cambio, baja ligeramente de 0,749 a 0,739 y de 0,782 a 0,728. En ambos modelos y dominios disminuye la alineación género-personalidad y aumentan DP y EO con el prompt sensible, mientras mejora la diversidad intralista. Los FPx publicados favorecen a DeepSeek, pero dependen de una suma no validada con pesos iguales y sin incertidumbre. La evidencia no sostiene un benchmark reproducible: no se identifican snapshots de los modelos, ejecuciones repetidas, código, datos derivados ni protocolo de emparejamiento de títulos. Además, MovieLens 10M declara oficialmente que no contiene datos demográficos, aunque el artículo calcula género, edad y ocupación sin explicar otra fuente; y el texto afirma que ChatGPT tiene menor sesgo pese a que sus propias tablas muestran DP y EO menores para DeepSeek. PerFairX aporta un vocabulario útil para discutir tensiones entre personalización y equidad, pero este experimento pequeño, circular y contradictorio no valida personalidad psicológica, equidad causal ni superioridad general de un modelo.
Pregunta de investigación
¿Cómo cambia la alineación entre recomendaciones y rasgos OCEAN inferidos cuando ChatGPT y DeepSeek reciben prompts neutrales o sensibles a la personalidad, qué efecto tiene ese cambio sobre disparidades demográficas y diversidad intralista, y qué modelo obtiene el mejor compromiso según el agregado PerFairX?