La versión de referencia es el artículo publicado en Findings of ACL 2025, no el preprint de arXiv que figuraba antes en la base. El preprint se centraba en GPT-4o y GPT-4 Turbo; la publicación estudia siete snapshots: GPT-4o, GPT-4o mini, GPT-4 Turbo, Claude 3 Sonnet, Claude 3 Haiku, Gemini 1.5 Pro y Gemini 1.5 Flash. El trabajo pregunta si instrucciones que describen niveles de los Big Five cambian las respuestas de los modelos a apuestas y si esos cambios siguen relaciones observadas en estudios humanos. Primero solicita directamente el equivalente cierto de una apuesta: la menor cantidad positiva o la cantidad negativa más extrema que el modelo aceptaría en vez de jugar, con una instrucción de razonar paso a paso. Cada experimento se repite 15 veces a temperatura 1; se fija una semilla por repetición cuando la API lo permite, pero Gemini Pro y Flash no admitían control de semilla. Con 56 apuestas mixtas de choices13k se ajustan cinco parámetros de teoría prospectiva acumulativa, sensibilidad a ganancias alpha, sensibilidad a pérdidas beta, aversión a pérdidas lambda y ponderación de probabilidad para ganancias y pérdidas, mediante Nelder-Mead, inicializado en las medianas humanas históricas. GPT-4o obtiene medianas alpha=0,99, beta=1,00, lambda=0,97, phi+=1,00 y phi-=1,00; Claude 3 Sonnet también queda muy próximo a uno. Gemini Pro y Flash aparecen exactamente en 1,00 en todos los parámetros y con intervalos degenerados. GPT-4o mini y Claude 3 Haiku presentan intervalos más amplios, especialmente en lambda. El artículo denomina a los primeros modelos aproximadamente neutrales al riesgo. Esa descripción se limita a este protocolo de respuesta numérica: pedir un equivalente cierto con razonamiento paso a paso puede inducir al modelo a calcular el valor esperado y no equivale a una elección incentivada, a una preferencia estable ni a conducta financiera real. La comparación humana tampoco está emparejada. Los parámetros de los LLM se ajustan sobre choices13k con el nuevo método, mientras que la referencia humana son estimaciones puntuales de 25 estudiantes de Tversky y Kahneman sobre otras apuestas; además, esas medianas humanas inicializan la optimización. Para personalidad basal, los modelos contestan el IPIP-NEO-300 y se comparan con 4.808 personas de Reino Unido e Irlanda mayores de 30 años. Los modelos suelen puntuar más alto en Apertura, Responsabilidad y Amabilidad y más bajo en Neuroticismo, pero son respuestas de autoinforme generadas en contexto, no evidencia de rasgos internos. La intervención concatena adjetivos bipolares de un único rasgo en el system prompt. En los experimentos de riesgo se usan los niveles 1, 3, 7 y 9. Para GPT-4o, la correlación de Spearman entre nivel de Apertura y alpha es 0,52, con beta 0,44 y con lambda -0,30. Para Claude 3 Sonnet es 0,41, 0,46 y -0,15. El signo de alpha y beta coincide con el patrón humano elegido por los autores: más Apertura se asocia con más búsqueda de riesgo en ganancias y menos en pérdidas. GPT-4o mini no muestra esa relación; Claude 3 Haiku y las variantes Gemini presentan signos parciales o inversos, y GPT-4 Turbo solo patrones locales entre subconjuntos de niveles. Al repetir el análisis de GPT-4o con los cinco rasgos, Apertura es el único rasgo marcado como significativo para alpha y beta; sin embargo, Amabilidad tiene una asociación significativa y de mayor magnitud con lambda (-0,44 frente a -0,30), por lo que decir que Apertura es el principal impulsor solo es defendible para las dos sensibilidades seleccionadas, no para todos los parámetros relacionados con riesgo. La interpretación psicológica está fuertemente confundida por el lenguaje del prompt: los marcadores incluyen adventurous and daring, timid/bold, spontaneous/predictable, impulsive/level-headed, careless/thorough y extravagant/thrifty. Esas palabras pueden dirigir por sí mismas la respuesta de riesgo. El estudio demuestra que cierto texto de persona cambia cierto texto de salida; no separa un rasgo Big Five abstracto del priming semántico. El apéndice comprueba con BFI-44, 50 repeticiones y los cuatro niveles que los cinco rasgos objetivo cambian mucho más que otros rasgos en GPT-4o y GPT-4o mini. Eso valida que el modelo obedece las etiquetas dentro de otro cuestionario, pero no elimina el confusor léxico ni demuestra estabilidad fuera del prompt. La publicación contiene además errores internos relevantes. La metodología define D como 56 apuestas mixtas, pero las Tablas 1 y 2 lo llaman no mixto. El texto define el nivel 4 como neutral, mientras el pseudocódigo coloca neutral en 5 y nivel 4 como a bit low. Un encabezado dice Claude Sonnet 2 aunque el modelo es Claude 3 Sonnet. Las limitaciones afirman que la intervención solo se verificó para Apertura en GPT-4o, contradiciendo el apéndice que informa los cinco rasgos en GPT-4o y mini. Las leyendas de significación son ambiguas o imposibles: las Tablas 1 y 2 usan 0,05/0,025/0,001 y las Tablas 13 y 14 imprimen 0,01/0,05/0,01 para una, dos y tres estrellas. No se dan p exactos, grados de libertad ni corrección por las numerosas comparaciones. Tampoco queda claro si las 15 muestras por nivel se tratan como observaciones independientes; no hay modelo jerárquico o análisis agrupado. El bootstrap usa 10.000 muestras, pero no se define qué unidad se remuestrea. No hay baseline de adjetivos aleatorios o semánticamente neutros, análisis de recuperación de parámetros, multistart del optimizador, validación fuera de muestra ni datos brutos. El paper imprime los prompts, versiones, tablas de apuestas y paquetes, pero no enlaza código o resultados. La muestra choices13k se describe como aleatoria sin semilla de selección. Finalmente, atribuir los contrastes entre modelos grandes y pequeños a destilación o transferencia de conocimiento excede el diseño: no se documenta linaje de entrenamiento, par de destilación controlado, arquitectura común ni experimento que aisle tamaño. La conclusión fiel es más estrecha: en estos snapshots y bajo este prompt numérico, varios modelos producen parámetros cercanos a neutralidad; añadir descripciones de Apertura desplaza de forma monotónica alpha y beta en GPT-4o y Claude 3 Sonnet, pero no de modo uniforme en las demás familias. Es evidencia de steering contextual de respuestas a apuestas, no de personalidad latente, causalidad psicológica, cognición humana, efecto de destilación o comportamiento financiero real.
Pregunta de investigación
¿Cambian las respuestas de varios LLM a apuestas cuando el system prompt describe niveles de los Big Five, y siguen esos cambios las asociaciones entre Apertura y riesgo reportadas en estudios humanos?