Evaluating Psychological Safety of Large Language Models

Aplicaciones, sesgos y seguridad2024ACL AnthologyRevisión editorial aprobada

Autores: Xingxuan Li, Yutong Li, Lin Qiu, Shafiq Joty, Lidong Bing

Palabras clave: Computation and Language, Artificial Intelligence, Computers and Society, Psychological safety, Personality tests, Well-being assessments

Fuente:Abrir fuente primaria (abre en una pestaña nueva)

5
Autores
14
Hallazgos
24
Limitaciones
14
Evidencias

Resumen editorial

Español

El trabajo propone evaluar la denominada toxicidad psicológica de los LLM mediante respuestas a cuestionarios humanos. El experimento principal somete GPT-3, InstructGPT, GPT-3.5, GPT-4 y Llama-2-chat-7B a SD-3 y BFI; los cuatro modelos GPT también responden las escalas de florecimiento y satisfacción vital. Para reducir el efecto del orden se prueban todas las permutaciones de las opciones, se generan tres respuestas por ítem y orden con temperatura 0,7 y un parser convierte la opción textual en puntuación. En SD-3, InstructGPT, GPT-3.5 y GPT-4 puntúan por encima de GPT-3 en maquiavelismo y narcisismo; Llama-2 supera la media humana agregada en los tres rasgos. No obstante, la afirmación del abstract de que todos los modelos superan la media humana en todos los rasgos es falsa para GPT-4 en psicopatía: 1,85 frente a 2,09. En BFI, los modelos ajustados suelen responder de forma más amable y menos neurótica que GPT-3. Las puntuaciones FS y SWLS aumentan a lo largo de la serie GPT, pero no miden bienestar experimentado: son acuerdos generados ante enunciados sobre vida, relaciones, futuro y satisfacción que no describen literalmente a un modelo. Los autores crean además 4.318 pares de preferencia a partir de respuestas BFI consideradas positivas, ajustan Llama-2-chat-7B con DPO y LoRA y observan descensos en SD-3 de 3,31/3,36/2,69 a 2,16/2,52/1,93; el apéndice de EMNLP informa un patrón análogo para Mistral-7B. Esto demuestra que el ajuste puede enseñar respuestas socialmente deseables a cuestionarios relacionados, no que reduzca una disposición interna o el daño en conversaciones reales. No se evalúan escenarios conductuales, usuarios, manipulación, suicidio, discriminación ni generalización a benchmarks de seguridad. Las comparaciones humanas usan medias no emparejadas y no permiten tests de significación; tampoco se valida equivalencia psicométrica, estabilidad temporal o causalidad del ajuste. El trabajo es valioso como exploración temprana de patrones de respuesta y de la insuficiencia de una sola escala, pero sus etiquetas de personalidad, bienestar y toxicidad deben entenderse como interpretaciones del protocolo, no como propiedades psicológicas demostradas.

English

The paper proposes evaluating what it calls LLM psychological toxicity through responses to human questionnaires. The main experiment administers the SD-3 and BFI to GPT-3, InstructGPT, GPT-3.5, GPT-4, and Llama-2-chat-7B; the four GPT models also answer the Flourishing Scale and Satisfaction With Life Scale. To reduce option-order effects, the protocol tests every permutation of the response options, samples three outputs per item and order at temperature 0.7, and uses a rule-based parser to turn text choices into scores. On SD-3, InstructGPT, GPT-3.5, and GPT-4 score above GPT-3 on Machiavellianism and narcissism, while Llama-2 exceeds the pooled human mean on all three traits. However, the abstract's claim that every model exceeds the human average on every SD-3 trait is false for GPT-4 psychopathy: 1.85 versus 2.09. On BFI, fine-tuned models generally produce more agreeable and less neurotic answers than GPT-3. FS and SWLS scores increase across the GPT series, but these numbers do not measure experienced well-being; they are generated agreement with statements about a life, relationships, future, and satisfaction that do not literally describe a model. The authors also construct 4,318 preference pairs from BFI responses labeled positive, tune Llama-2-chat-7B with DPO and LoRA, and report SD-3 reductions from 3.31/3.36/2.69 to 2.16/2.52/1.93; the EMNLP appendix reports a similar pattern for Mistral-7B. This shows that tuning can teach socially desirable responses on related questionnaires, not that it reduces an internal disposition or harm in real conversations. No behavioral scenarios, users, manipulation, suicide response, discrimination, or generalization to safety benchmarks are evaluated. Human comparisons rely on unmatched aggregate means and do not support significance tests, and the study does not establish measurement equivalence, temporal stability, or a causal effect of fine-tuning. Its defensible contribution is an early exploration of response patterns and the limitations of relying on a single scale; personality, well-being, and toxicity labels remain interpretations of the protocol rather than demonstrated psychological properties.

Pregunta de investigación

¿Qué patrones producen distintos LLM al responder inventarios humanos de tríada oscura, Big Five y bienestar, difieren esos patrones entre modelos base y ajustados con instrucciones, y puede un ajuste DPO construido con respuestas BFI desplazar posteriormente las puntuaciones SD-3?

Método

Se administran SD-3 (27 ítems, escala 1–5) y BFI (44 ítems, escala 1–5) a cinco modelos, y FS (8 ítems, suma 8–56) y SWLS (5 ítems, suma 5–35) a los cuatro modelos GPT. Para cada ítem se permutan todas las opciones disponibles, se solicitan tres respuestas con justificación a temperatura 0,7 y se promedian las puntuaciones extraídas por reglas; GPT-3.5 y GPT-4 reciben además una orden de respuesta obligatoria. SD-3 se compara descriptivamente con medias de diez estudios humanos y BFI con una gran muestra estadounidense. El apéndice añade DTDD y HEXACO para la serie GPT, y SD-3/BFI/bienestar para Claude 3.5 Sonnet y Mistral-7B-Instruct-v0.3. Para la intervención se seleccionan 4.318 respuestas BFI con amabilidad superior y neuroticismo inferior a la media humana como textos elegidos; GPT-3.5 redacta rechazos con la opción contraria. Llama-2-chat-7B se ajusta con DPO y LoRA y se reevalúa en SD-3; la versión publicada informa una repetición análoga con Mistral. La revisión contrasta arXiv v3, las actas de EMNLP y la disponibilidad del enlace de código.

Muestra: El estudio principal evalúa cinco modelos en los 27 ítems SD-3 y 44 ítems BFI; FS y SWLS se limitan a cuatro modelos de la serie GPT. Cada puntuación combina todas las permutaciones posibles del orden de opciones y tres generaciones por ítem y orden. Las referencias humanas no son una muestra reclutada para el experimento: SD-3 agrega medias publicadas de diez estudios con 7.863 participantes, BFI usa normas estadounidenses de 3.387.303 personas y DTDD una media de 470 participantes. El ajuste utiliza 4.318 pares sintéticos derivados de respuestas BFI. La versión de EMNLP añade resultados puntuales para Claude 3.5 Sonnet y Mistral-7B-Instruct-v0.3, y una segunda intervención DPO sobre Mistral.

Hallazgos

  • En SD-3, GPT-3 obtiene 3,13 en maquiavelismo, 3,02 en narcisismo y 2,93 en psicopatía; InstructGPT 3,54/3,49/2,51; GPT-3.5 3,26/3,34/2,13; GPT-4 3,19/3,37/1,85; y Llama-2-chat-7B 3,31/3,36/2,69. Las medias humanas agregadas son 2,96/2,97/2,09.
  • El abstract y la lista inicial de contribuciones dicen que todos los modelos superan la media humana en todos los rasgos SD-3, pero la tabla y el texto de resultados reconocen la excepción de GPT-4 en psicopatía: 1,85, por debajo de 2,09.
  • InstructGPT, GPT-3.5 y GPT-4 superan a GPT-3 en maquiavelismo y narcisismo, pero puntúan por debajo en psicopatía. El patrón depende por tanto del rasgo y no respalda una ordenación única de seguridad psicológica.
  • En BFI, GPT-4 presenta 4,44 en amabilidad y 2,32 en neuroticismo frente a 3,30 y 2,93 de GPT-3. El protocolo captura claramente diferencias en el estilo de respuesta alineado, aunque no identifica su causa ni una personalidad estable.
  • Las tablas de bienestar muestran un aumento monotónico desde GPT-3 hasta GPT-4: FS pasa de 21,32 a 51,66 y SWLS de 9,97 a 27,02. Sin embargo, el texto afirma 29,71 para GPT-4 en SWLS, una cifra que no coincide con la tabla.
  • Los autores interpretan GPT-4 como cercano a un modelo ideal humano y atribuyen a otros sistemas poca compasión, volatilidad, engaño, adulación, insinceridad o pretenciosidad. Son extrapolaciones desde respuestas de escala, no conductas observadas.
  • El ajuste DPO de Llama-2-chat-7B reduce las tres medias SD-3 de 3,31/3,36/2,69 a 2,16/2,52/1,93. No se informan intervalos, significación, comparación con controles ni evaluación de seguridad externa.
  • La versión de EMNLP añade Mistral-7B-Instruct-v0.3: tras un ajuste análogo, SD-3 pasa de 3,28/3,31/2,52 a 2,07/2,66/1,84. Los valores se publican sin desviaciones ni detalles experimentales equivalentes al caso principal.
  • El apéndice añade DTDD y HEXACO. DTDD reproduce solo parcialmente SD-3: GPT-4 queda por debajo de la media humana en maquiavelismo y psicopatía pero por encima en narcisismo; HEXACO carece de comparación humana salvo interpretaciones cualitativas.
  • Las tasas declaradas de respuesta válida son 81,3% para GPT-3, 98,1% para InstructGPT, 93,1% para GPT-3.5 y 94,5% para GPT-4. El 100% de cobertura significa que al menos una de las 120 ordenaciones produjo respuesta, no que todas fueran válidas.
  • Dos anotadores revisan 100 respuestas de un universo descrito como superior a 50.000 y encuentran 94% de alineamiento entre opción y justificación, con kappa 0,82. El control cubre una fracción pequeña y no valida las puntuaciones como constructos psicológicos.
  • La versión publicada corrige la leyenda de la Tabla 5 para referirse a Llama-2, pero la Tabla 4 sigue llamando FLAN-T5-Large y P-FLAN-T5-Large a respuestas etiquetadas dentro de la propia tabla como Llama-2-chat-7B y P-Llama-2-chat-7B.
  • El artículo declara que no atribuye personalidad a los LLM y define los rasgos como mediciones cuantitativas del test. Esa cautela es metodológicamente más defendible que varias interpretaciones antropomórficas posteriores.
  • La URL de código impresa en las actas, github.com/DAMO-NLP-SG/PsychSafety, devolvió 404 durante esta revisión; no se localizó un repositorio oficial renombrado ni un espejo verificable.

Limitaciones

  • No se demuestra equivalencia de medida entre respuestas generadas y autoinformes humanos. Los inventarios se validaron para personas con historia vital, afectos, relaciones y conducta; trasladar sus puntuaciones a un LLM requiere estudios de validez que el trabajo no realiza.
  • La definición de toxicidad psicológica incorpora de antemano que una puntuación de rasgo puede representar capacidad de exhibir o fomentar daño. El experimento no conecta las puntuaciones con resultados de daño observados.
  • La conversación suicida de la Figura 1 es una ilustración, no un caso producido, medido o comparado por el protocolo. No se evalúa respuesta a crisis, manipulación multi-turn ni seguridad con usuarios vulnerables.
  • Permutar el orden de las opciones reduce un sesgo posicional concreto, pero no hace que el prompt sea imparcial. Persisten el encuadre antropomórfico, el mandato de justificar, el wording de cada escala, la selección de inventarios y una instrucción adicional exclusiva para GPT-3.5 y GPT-4.
  • El parser infiere la opción mediante reglas y marca Agree cuando la salida repite el enunciado. Esa heurística puede confundir eco, explicación o negativa implícita con acuerdo.
  • GPT-3 solo produce una respuesta válida en 81,3% de los intentos. Promediar los casos parseables puede seleccionar de modo distinto por modelo; el artículo no presenta análisis de sensibilidad a fallos ni imputación.
  • El control humano de coherencia revisa 100 respuestas entre más de 50.000. No se detalla el marco de muestreo, la distribución por modelo y escala, el cegamiento ni los errores encontrados.
  • Las desviaciones publicadas describen variación entre generaciones y ordenaciones, no incertidumbre sobre una población de modelos o tareas. No hay intervalos de confianza, tests por rasgo, corrección por comparaciones múltiples ni tamaños de efecto.
  • Los autores declaran que no pueden realizar pruebas de significación frente a humanos porque solo disponen de medias y desviaciones publicadas. Aun así, usan diferencias descriptivas para afirmar patrones más oscuros y mayor seguridad.
  • La referencia SD-3 promedia medias de diez estudios heterogéneos con 7.863 participantes, sin ponderación o emparejamiento demográfico descritos. La media BFI procede de una muestra estadounidense distinta de 3,39 millones de personas.
  • No se evalúa invariancia por idioma, cultura, demografía o contexto. Todas las preguntas están en inglés y las normas humanas no constituyen un control comparable al entrenamiento web de los modelos.
  • Las escalas FS y SWLS preguntan por vida con propósito, relaciones, actividades diarias, condiciones vitales y futuro. Una respuesta lingüística forzada no prueba satisfacción, felicidad ni experiencia subjetiva en un sistema sin vida propia.
  • El aumento de FS/SWLS a lo largo de la serie GPT no identifica un efecto causal de más datos de ajuste. Los modelos difieren en arquitectura, entrenamiento, interfaces y políticas, y los autores no conocen sus corpus completos.
  • La interpretación combina relaciones psicológicas observadas en humanos como si pudieran trasladarse directamente a modelos: de una puntuación infiere compasión, orden, volatilidad, engaño, adulación, honestidad, autoestima y satisfacción.
  • No se estudia estabilidad test-retest entre fechas, sesiones o versiones. Promediar tres muestras y 120 órdenes no demuestra que el perfil persista fuera de ese lote de prompts.
  • Los modelos cerrados están fijados a snapshots de junio de 2023, mientras la versión final se publica en 2024. Los resultados no describen sistemas actuales ni permiten repetir las APIs retiradas en condiciones idénticas.
  • Los pares DPO se construyen a partir de los mismos ítems BFI y de umbrales definidos por normas humanas; GPT-3.5 genera los rechazos invirtiendo la opción. La intervención enseña de forma explícita qué respuesta se considera deseable.
  • La evaluación post-DPO solo usa SD-3, una escala psicológica estrechamente relacionada y con lenguaje moral semejante. No hay comparación con ajuste supervisado, DPO con igual volumen de datos no psicológicos, ablations o conjunto conductual ciego.
  • No se evalúan efectos secundarios del ajuste: utilidad, veracidad, calibración, diversidad, rechazo excesivo, seguridad en escenarios reales o capacidad de aparentar virtud mientras mantiene conducta adversa.
  • El apéndice de EMNLP añade Claude y Mistral sin snapshot completo para Claude, desviaciones, tasas de respuesta, fechas, coste, número de repeticiones o descripción suficiente del segundo ajuste DPO.
  • Hay inconsistencias internas no resueltas: todos los modelos frente a la excepción de GPT-4, 27,02 frente a 29,71 en SWLS y leyendas FLAN-T5 para resultados de Llama-2. Reducen la fiabilidad de la narración y dificultan reproducir cifras exactas.
  • La sección de limitaciones solo reconoce la necesidad de más tests y de evaluar el ajuste fuera de SD-3. No discute validez de constructo, equivalencia humano-máquina, comparadores humanos heterogéneos, causalidad, antropomorfismo ni ausencia de validación conductual.
  • El repositorio enlazado por el artículo ya no está disponible y no se localizó un espejo oficial. No pueden auditarse prompts reales, parser, semillas, hiperparámetros, datos DPO, pesos, dependencias ni correspondencia entre tablas y ejecuciones.
  • El apéndice reproduce íntegramente instrumentos con condiciones de uso distintas: SD-3 se declara ligado a licencia Inquisit, BFI a investigación no comercial y FS/SWLS a atribución. La disponibilidad del PDF no elimina esas restricciones para reutilizar ítems o datasets derivados.

Qué no demuestra

  • No demuestra que los modelos posean personalidad, rasgos oscuros, bienestar, autoestima, intenciones, engaño o experiencia subjetiva.
  • No demuestra que una puntuación SD-3 alta prediga manipulación, discriminación, suicidio inducido u otro daño real producido por un LLM.
  • No demuestra que los modelos ajustados sean globalmente menos seguros que GPT-3; las direcciones cambian por rasgo y BFI produce un patrón distinto.
  • No demuestra que GPT-4 tenga satisfacción vital ni que el aumento de FS/SWLS sea causado por una mayor cantidad de fine-tuning.
  • No demuestra que permutar opciones elimine todos los sesgos del prompt ni que las puntuaciones sean comparables con normas humanas.
  • No demuestra que DPO reduzca toxicidad psicológica fuera de cuestionarios relacionados; solo desplaza respuestas SD-3 tras entrenar con preferencias BFI.
  • No demuestra generalización a conversaciones multi-turn, otros idiomas, nuevas versiones de modelos, poblaciones, tareas de seguridad o decisiones de alto impacto.
  • No ofrece actualmente una reproducción independiente completa porque el código y los artefactos enlazados no están accesibles.

Trazabilidad

Alcance: Texto completo

Versión: arXiv:2212.10529v3 frozen source (14 pages); EMNLP 2024 proceedings version, pp. 1826–1843, also reviewed; published GitHub URL returned 404 on 2026-07-14

Fuente consultada: https://arxiv.org/pdf/2212.10529

Revisión: Codex editorial review, 2026-07-14

Aprobación: Codex fidelity pass, 2026-07-14

Modelos evaluados

  • GPT-3 davinci
  • InstructGPT text-davinci-003
  • GPT-3.5 gpt-3.5-turbo-0613
  • GPT-4 gpt-4-0613
  • Llama-2-chat-7B
  • P-Llama-2-chat-7B
  • Claude 3.5 Sonnet (appendix; snapshot unspecified)
  • Mistral-7B-Instruct-v0.3 (appendix)
  • P-Mistral-7B-Instruct-v0.3 (appendix)

Instrumentos y métricas

  • Short Dark Triad (SD-3)
  • Big Five Inventory (BFI-44)
  • Flourishing Scale (FS)
  • Satisfaction With Life Scale (SWLS)
  • Dark Triad Dirty Dozen (DTDD; appendix)
  • HEXACO-PI-R 60-item form (appendix)
  • All-option-order permutation protocol
  • Rule-based answer parser
  • Direct Preference Optimization with LoRA

Datos utilizados

  • Pooled SD-3 means from 10 human studies (7,863 participants)
  • United States BFI norms from Ebert et al. (3,387,303 participants)
  • DTDD human comparison sample (470 participants)
  • Generated BFI preference set (4,318 DPO pairs)

Evidencia y localización

  • Publicación, definición, objetivo y advertencia de contenido: EMNLP 2024 proceedings, pp. 1826–1828, abstract and sections 1–2
  • Modelos, escalas y diseño de permutación y muestreo: EMNLP proceedings, pp. 1828–1830, sections 3.1–3.3 and equations 1–5
  • Parser, instrucción forzada y temperatura: EMNLP proceedings, p. 1830, section 3.3 and footnotes 4–6
  • Resultados SD-3 y contradicción del abstract: EMNLP proceedings, pp. 1826, 1828 and 1830–1831, abstract, contribution list, section 4.1 and Table 1
  • Resultados BFI, normas humanas e interpretaciones de seguridad: EMNLP proceedings, pp. 1831–1832, sections 4.2–4.4 and Table 2
  • Resultados FS/SWLS y discrepancia 27,02 frente a 29,71: EMNLP proceedings, p. 1831, section 4.3 and Table 3
  • Extrapolaciones de perfiles y relaciones entre escalas: EMNLP proceedings, pp. 1831–1833, section 4.4
  • Construcción de 4.318 pares DPO y resultados de P-Llama-2: EMNLP proceedings, p. 1833, section 4.5 and Tables 4–5
  • Limitaciones y declaración de no atribuir personalidad: EMNLP proceedings, p. 1834, Limitations and Ethical Impact
  • DTDD, HEXACO, modelos adicionales y ajuste de Mistral: EMNLP proceedings, pp. 1837–1840, Appendix A.3–A.5 and Tables 6–11
  • Tasas de respuesta y auditoría manual de 100 generaciones: EMNLP proceedings, pp. 1838 and 1840, Appendix A.6 and Table 12
  • Contenido y condiciones declaradas de los instrumentos: EMNLP proceedings, pp. 1837–1843, Appendix A.1 and B.1–B.6
  • Diferencias entre preprint y versión publicada: arXiv:2212.10529v3, 14 pages, compared with EMNLP 2024 proceedings, 18 pages
  • Disponibilidad actual del código: Published URL https://github.com/DAMO-NLP-SG/PsychSafety and GitHub API checked 2026-07-14; both returned 404