Este trabajo de cinco páginas, publicado en WWW Companion 2025, administra cinco inventarios de personalidad reformulados a GPT-4, GPT-4o-mini, Llama-3-8B-Instruct, Llama-3.1-8B-Instruct y Llama-3.2-3B-Instruct. GPT-4o reescribe los ítems; all-MiniLM-L6-v2 exige similitud coseno de al menos 0,7 con el original y los autores indican supervisión humana para reconstruir ítems por debajo del umbral. Los ítems se randomizan, se envían en lotes de diez y se repiten 100 veces con temperatura 0 en OpenAI y 0,01 en Llama. La Tabla 2 publica únicamente la media por modelo, inventario y dimensión. No se localizó código, prompts completos, versiones reformuladas, respuestas crudas ni configuración reproducible. El protocolo no elimina ni mide contaminación de entrenamiento. Una paráfrasis semánticamente próxima puede seguir siendo reconocible y haber sido generada por un modelo que conoce el instrumento; el umbral de similitud evalúa parecido textual, no presencia en datos de entrenamiento. Tampoco valida que la reformulación conserve puntuación, estructura factorial o interpretación psicométrica. El system prompt presenta al modelo como un helpful assistant y le exige autoevaluarse, por lo que las respuestas pueden reflejar alineamiento, obediencia al formato y estereotipos sobre un asistente útil, no rasgos latentes. La selección de instrumentos contiene errores conceptuales. HEXACO-100 mide seis factores; el artículo omite Honestidad-Humildad y fuerza Emotionality/otros dominios a cinco etiquetas Big Five. La escala citada como NEO-PI-R de 60 ítems es realmente IPIP-NEO-60, una representación pública del NEO PI-R. TIPI usa 1–7 y los otros cuatro inventarios se presentan en 1–5. Aun así, la dimensión dominante se calcula promediando sin normalización las cinco medias, dando a TIPI un rango mayor. Una sensibilidad que transforma TIPI linealmente a 1–5 conserva por casualidad las cinco etiquetas dominantes, pero cambia sus medias y no resuelve la falta de equivalencia entre constructos. El coeficiente de variación tampoco mide lo que sugiere el texto. Aunque se mencionan 100 ejecuciones, la Tabla 3 se reproduce, para los tres primeros modelos, calculando desviación estándar poblacional sobre solo cuatro promedios de inventario por dimensión, excluyendo TIPI. Por tanto, Neuroticismo 20,49% en GPT-4 o 33,69% en Llama 3.1 describen desacuerdo entre instrumentos, no fluctuación entre 100 respuestas. No se publican SD o intervalos entre ejecuciones. Las cifras de Llama 3.1 y 3.2 no se reproducen enteramente desde la Tabla 2; en Llama 3.2, el CV publicado de Extraversion 21,93% queda fuera del rango 24,08–25,93% compatible con el redondeo mostrado. Los promedios descriptivos sí muestran un patrón: puntuaciones crudas altas en Agreeableness, Conscientiousness u Openness y bajas en Neuroticism bajo este prompt y estos ítems. La dimensión dominante declarada es Agreeableness para GPT-4, GPT-4o-mini y Llama 3.2, Conscientiousness para Llama 3 y Openness para Llama 3.1. Sin normas humanas, calibración común, incertidumbre, pruebas estadísticas o validación conductual, esos números no establecen perfiles de personalidad. Las interpretaciones causales sobre fine-tuning y objetivos de diseño tampoco se prueban. La conclusión defendible es limitada: cinco modelos alineados producen patrones de respuesta distintos entre cuestionarios y familias bajo un protocolo de autoinforme reformulado. El trabajo sirve para mostrar que instrumento, escala y prompt importan; no demuestra rasgos psicológicos, fiabilidad psicométrica, eliminación de contaminación, personalidad familiar del modelo ni que los perfiles predigan conducta fuera del cuestionario.
Pregunta de investigación
¿Qué patrones de puntuación Big Five producen cinco LLM al responder versiones reformuladas de cinco inventarios, y cuánto difieren los promedios entre dimensiones, instrumentos y familias de modelo?