LMLPA propone sustituir la administración directa del Big Five Inventory a un LLM por un cuestionario adaptado a capacidades lingüísticas. Convierte los 44 ítems BFI en preguntas abiertas del tipo «¿hasta qué punto…?», obliga al modelo a incluir siempre, often, sometimes, rarely o never y una justificación de una frase, y encarga a otro modelo transformar el texto en una puntuación 1–5. Cinco profesionales de psicología revisaron cualitativamente las adaptaciones; después, PCA elimina cuatro ítems y deja una versión final de 40. La aportación más útil es publicar íntegramente preguntas, prompts, etiquetas y análisis de sensibilidad al orden, reconociendo además que los LLM no poseen acciones, emociones o procesos cognitivos humanos y que su output se usa como proxy lingüístico.
En las pruebas de orden, GPT-4-Turbo responde los 44 ítems en llamadas separadas y a temperatura 0. Al invertir la lista de adverbios obligatorios, siete pares se consideran realmente discordantes después de corregir manualmente un caso semánticamente equivalente, con kappa ponderado 0,730. En la comparación posterior, el BFI numérico produce 16 discrepancias y kappa 0,401, mientras el sistema completo LMLPA produce seis y kappa 0,877. Esto demuestra mayor estabilidad de outputs bajo esas dos configuraciones, pero no aísla el efecto del cuestionario abierto: en BFI se invierte la escala que ve el modelo evaluado; en LMLPA se invierte la escala que ve GPT-4-Turbo como juez. La lista ordenada de cinco adverbios sigue dentro del prompt del test-taker y la lista de cinco etiquetas se desplaza al rater, por lo que no desaparece la estructura de opción; cambia de etapa.
Tres de los expertos puntúan un único conjunto de 44 respuestas de GPT-4-Turbo. Las correlaciones del rater GPT-4-Turbo con ellos son 0,827–0,877 y su ICC de medida individual es 0,829; BART-Large-MNLI obtiene 0,700–0,810 e ICC 0,766 y Llama3-8B 0,750–0,840 e ICC 0,785. Es evidencia de acuerdo para respuestas muy estructuradas que contienen un adverbio de frecuencia obligatorio, no de exactitud del rasgo. El tipo exacto de ICC y su supuesto de acuerdo/consistencia no se especifican; el ICC «average measures» combina cuatro ratings y no representa el rendimiento de un juez individual. Llama3 muestra además kappa 0,279 cuando se invierten sus opciones, por lo que se excluye de la fase psicométrica precisa.
La consistencia y la estructura se estiman con 250 condiciones generadas por el mismo GPT-4-Turbo: diez descripciones PersonaChat combinadas con 25 perfiles que escriben explícitamente cinco niveles de cada rasgo en el system prompt. Los alfas sobre los 44 ítems son 0,869–0,936, pero pueden reflejar redundancia de ítems, obediencia al prompt, método y juez comunes; no se recalculan tras eliminar Q31, Q35, Q41 y Q22 para formar la escala final de 40. La PCA obtiene KMO 0,951 y cuatro componentes, no cinco; Conscientiousness se reparte entre varios, hay numerosas cargas cruzadas y el texto llega a atribuir Neuroticism al componente 3 aunque la tabla lo concentra en el 2. La misma muestra se usa para eliminar ítems y declarar validez, sin CFA o réplica independiente.
La prueba final vuelve a tratar como «ground truth» los adjetivos Big Five insertados directamente en el prompt de GPT-4-Turbo, Llama3-8B-Instruct y Mistral-7B-Instruct-v0.2. Las distribuciones suelen moverse en la dirección pedida, pero no coinciden con los niveles, baja agradabilidad se concentra en 2–3 y el neuroticismo de Llama3 se mueve en dirección contraria en el extremo; no se publica una métrica de error, correlación o clasificación. Cuando GPT-4-Turbo genera y juzga, existe circularidad de modelo y conocimiento compartido del instrumento. Sin snapshots precisos del servicio, semillas, repeticiones, outputs, datos o código público, el protocolo no es reproducible íntegramente. En consecuencia, LMLPA es un instrumento abierto y prometedor para describir autodeclaraciones lingüísticas condicionadas por prompts, pero sus datos no prueban una personalidad latente, estable, predictiva o equivalente al Big Five humano.