CFaiRLLM estudia equidad del lado del consumidor en recomendadores basados en LLM; no usa perfiles psicológicos ni evalúa personalidad. Su punto de partida es que comparar una lista neutral con otra que incluye un atributo sensible puede confundir personalización legítima con sesgo. El marco añade dos elementos: contrasta las recomendaciones con interacciones futuras del usuario, que denomina “preferencias verdaderas”, y examina atributos interseccionales. Los perfiles se construyen seleccionando del historial 10 ítems al azar, mejor valorados o más recientes. GPT-3.5 genera recomendaciones para MovieLens-1M y LastFM-1K; GPT-4o mini también se prueba en LastFM. Los atributos son sexo binario, tres grupos de edad y sus seis intersecciones.
La evaluación compara listas neutrales y sensibles mediante Jaccard@K y PRAG@K, primero sobre todos los ítems y después conservando solo recomendaciones presentes en el test temporal de cada usuario. Las diferencias entre grupos se resumen con SNSR y SNSV, donde valores mayores significan mayor desigualdad. Sobre una muestra de 150 usuarios por dominio, el artículo encuentra que introducir atributos sensibles cambia las listas, que las brechas suelen crecer al combinar sexo y edad y que LastFM es menos estable que MovieLens. El muestreo del perfil importa: aleatorio suele favorecer la coincidencia Jaccard, mientras reciente o mejor valorado puede favorecer el orden PRAG; no hay una estrategia universal.
La afirmación central sobre la superioridad de la alineación con preferencias reales no queda demostrada de forma consistente. El propio ejemplo de sexo con muestreo aleatorio da SNSR 0,0210 y SNSV 0,0105 al filtrar por test, frente a 0,0010 y 0,0005 con similitud de listas: la desigualdad es 21 veces mayor, no entre tres y diez veces menor. Otros escenarios de mejor valorados sí muestran reducciones, por lo que la dirección depende del escenario. Además, “significativo” se usa sin tests, intervalos, repeticiones ni control por comparaciones. Un único muestreo aleatorio sin semilla y llamadas no repetidas a APIs cerradas impiden estimar variabilidad.
El filtro de test es una aproximación observacional a preferencia, no una verdad verificada: penaliza recomendaciones novedosas, hereda sesgos del comportamiento histórico y produce coincidencias muy escasas. El estudio no mide satisfacción, utilidad, exposición, daño, equidad de proveedores ni discriminación causal. Tampoco publica tamaños por subgrupo, protocolo reproducible para los 150 usuarios, snapshots completos del modelo, temperatura, semillas o código. Por ello, CFaiRLLM es relevante como propuesta de auditoría de recomendadores e interseccionalidad, pero no aporta evidencia sobre personalidad sintética, rasgos, neuroticismo ni explotación psicológica.