Cho y Cheong presentan Big5-Scaler, una familia de instrucciones que escribe los cinco rasgos OCEAN como puntuaciones numéricas de x sobre n y pide al modelo que responda de acuerdo con ellas. Hay tres variantes: simple, con una frase por rasgo; specific, con seis descripciones de facetas por rasgo; y simspec, que combina ambos niveles. El trabajo estudia cinco cuestiones distintas, pero no todas con los mismos modelos ni el mismo diseño. Primero, Alpaca-7B responde el MPI de 1.000 ítems cuando se maximiza un solo rasgo y se compara con una condición neutral y tres baselines de prompting. Big5-Scaler simple obtiene la mayor media en apertura, responsabilidad, extraversión y amabilidad; en neuroticismo, la condición neutral (3,01) supera a todas las inducciones y la mejor variante Big5-Scaler queda en 2,73. Segundo, LLaMA3-8B, un modelo denominado Mistral-25B y Phi-4-14B contestan BFI, IPIP-NEO-120 y NEO-FFI mientras el rasgo objetivo varía de 0 a 90 y los otros cuatro quedan en 50. Muchas correlaciones entre puntuación indicada y cuestionario son altas, pero hay fallos claros, sobre todo en LLaMA: por ejemplo, apertura con IPIP bajo prompt simple r=-0,235, responsabilidad con prompt specific r=0,032 y apertura con BFI simple r=0,486. Estas pruebas miden si el modelo reproduce en un autoinforme instrucciones que ya nombran y describen el mismo constructo; no son una validación independiente en conducta abierta. Tercero, se generan diálogos de 20 turnos entre agentes con perfiles aleatorios. Tres jueces LLM aciertan cuál de dos agentes expresa más un rasgo entre 35,4% y 47,4%, frente al 33,3% esperado al elegir entre A, B o igual; el artículo no aporta tamaño de muestra, intervalos, pruebas ni evaluación humana para esta tarea. Cuarto, se compara la concatenación de los nueve primeros turnos de cada agente con el décimo: el coseno es 0,999 para los tres modelos, BERTScore queda entre 0,480 y 0,537 y PersonaCLR entre 0,789 y 0,828. Esa semejanza textual o estilística no identifica por sí sola estabilidad de rasgo, y el coseno casi perfecto carece de especificación suficiente para interpretarlo. Quinto, 17 estudiantes de posgrado coreanos de NLP completan IPIP-NEO-120; sus scores se convierten en prompts y el modelo vuelve a contestar el mismo inventario. Los RMSE publicados, 1,785–1,822, mejoran solo modestamente un azar aproximado de 2,0, sin incertidumbre ni contraste estadístico. Un análisis adicional crea 50 agentes por combinación de modelo, tipo de prompt y escala n en {10,25,50,100}; Phi-4-14B, simple, n=10 logra el menor RMSE medio (21,587), apenas 0,020 mejor que el mismo modelo con n=50. La afirmación narrativa de que n=10 gana de forma consistente tiene una excepción en Mistral-specific, cuyo mejor promedio es n=100, y varias excepciones por cuestionario. El artículo aporta evidencia útil de control de respuestas de cuestionario y señales lingüísticas mediante prompting explícito, pero no demuestra personalidad interna, equivalencia humana ni fidelidad individual alta.
Pregunta de investigación
¿Puede una instrucción sin entrenamiento adicional, que expresa los cinco rasgos Big Five mediante valores numéricos y descripciones de distinto detalle, controlar proporcionalmente las respuestas de LLM, producir señales distinguibles y consistentes en diálogo y aproximar perfiles humanos?