La evolución en las capacidades de razonamiento de los grandes modelos de lenguaje no mitiga de forma automática los sesgos discriminatorios en el ámbito sanitario. Una investigación desarrollada por la Universidad de Flinders y publicada en el Journal of Medical Internet Research demuestra que arquitecturas avanzadas como o3-mini y DeepSeek-R1 reproducen e incluso amplifican los estereotipos raciales y de género al generar contenido clínico.
Arquitectura de la investigación y métricas de error
Para evaluar la imparcialidad representacional de estos sistemas, el equipo académico analizó la generación de 36.000 viñetas clínicas únicas referidas a patologías comunes. Los resultados indican que el rendimiento superior en las pruebas de referencia lógicas no se traduce en equidad estadística. Mientras que GPT-4 presentaba una representación errónea significativa en el 67 % de las afecciones tanto para raza como para género, los modelos de razonamiento evaluados elevaron estas cifras de manera notable.
- o3-mini: Registró un 78 % de errores de representación en la variable racial y un 56 % en la de género.
- DeepSeek-R1: Alcanzó un 89 % de desviaciones en la distribución racial y un 67 % en la demografía de género.
- Patrones específicos: Se detectó una sobrerrepresentación sistemática de poblaciones negras en patologías como sarcoidosis, lupus eritematoso sistémico, preeclampsia e hipertensión esencial.
- Magnitud del sesgo: La mediana de representación errónea en estas afecciones escaló hasta el 44 % en o3-mini y el 31 % en DeepSeek-R1, superando el 15 % registrado previamente por iteraciones anteriores.
El análisis algorítmico y los sesgos en los datos de entrenamiento
El examen cualitativo de las trazas de razonamiento de DeepSeek-R1 evidencia que el modelo invoca asociaciones explícitas entre diagnósticos médicos y perfiles demográficos concretos. En lugar de basarse en métricas epidemiológicas cuantitativas objetivas, el sistema tiende a priorizar casos prototípicos derivados de los corpus de texto utilizados en su fase de entrenamiento, consolidando sesgos sistémicos previos.
Este estudio evaluó si los modelos de lógica de razonamiento presentan sesgos raciales y de género en el contenido clínico generado. Los resultados muestran tasas comparables o superiores para o3-mini y DeepSeek-R1, lo que indica que no hay mejora en la representación con los modelos de razonamiento más recientes. (Joshua Docking y Michael Sorich, Universidad de Flinders)
Implicaciones para la soberanía clínica y la integración digital
Este fenómeno pone de manifiesto que la complejidad computacional y la potencia analítica de la nueva Tecnología no garantizan la neutralidad ética. La adopción de estos sistemas en la práctica médica requiere marcos de validación rigurosos para evitar que la automatización perpetúe las desigualdades estructurales en la atención a los pacientes.
Es fundamental conocer estas características demográficas predeterminadas para la integración segura de los modelos de regresión logística en los flujos de trabajo clínicos, y su adopción debe ir acompañada de un seguimiento continuo de los posibles sesgos. (Michael Sorich)
¿Cuál es tu valoración sobre este acontecimiento?



GIPHY App Key not set. Please check settings