El artículo propone el Machine Personality Inventory (MPI), una conversión de ítems Big Five de IPIP/IPIP-NEO y BFI-S en preguntas de opción múltiple para describir patrones de respuesta de modelos, y Personality Prompting (P²), una cadena de prompts para aumentar o reducir un rasgo objetivo. Se comparan seis sistemas: BART-large-MNLI, GPT-Neo 2.7B, GPT-NeoX 20B, T0++ 11B, Alpaca 7B y text-davinci-003, etiquetado como GPT-3.5 175B. Cada modelo responde versiones de 120 y aproximadamente 1.000 ítems a temperatura cero con plantillas adaptadas a su formato. Para cada rasgo se calcula la media OCEAN y la desviación estándar entre ítems; esta desviación se interpreta como «consistencia interna» y se contrasta descriptivamente con 619.150 respuestas humanas del IPIP-NEO-120. Alpaca y GPT-3.5 producen dispersiones y medias más próximas a las referencias humanas que los tres modelos base, aunque el estudio no aplica alfa, omega, test-retest, análisis factorial ni equivalencia de medida. P² se prueba principalmente sobre GPT-3.5: parte de una instrucción simple, incorpora palabras descriptivas de la literatura psicológica y pide al propio modelo redactar un retrato más detallado. En MPI eleva el rasgo objetivo respecto al prompt neutral, pero también altera rasgos no objetivo y no supera uniformemente a los dos baselines. La validación externa usa cinco viñetas y juicios comparativos de 100 participantes de Prolific. P² obtiene altas tasas de reconocimiento para apertura y extraversión positivas y negativas, pero la inducción de baja responsabilidad solo alcanza 0,45, por debajo del azar nominal. El apéndice muestra que Alpaca separa peor los rasgos y que para GPT-3.5 las paráfrasis del prompt cambian los resultados. La evidencia respalda que determinados prompts controlan patrones de cuestionario y texto en una instantánea concreta; no valida una personalidad interna, estable o equivalente a la humana.
Pregunta de investigación
¿Pueden inventarios Big Five convertidos a opción múltiple describir cuantitativamente patrones de respuesta de LLM y puede una cadena de prompting inducir de forma reconocible niveles positivos o negativos de cada rasgo?