Исследование выявило сомнительные данные в моделях ИИ для прогнозирования инсульта и диабета

Группа исследователей из Квинслендского технологического университета под руководством статистика Адриана Барнетта выявила, что 124 научных статьи по прогнозированию риска инсульта и диабета основаны на сомнительных данных. В частности, два широко используемых набора данных — для инсульта и диабета — имеют неясное происхождение и содержат аномалии.

Первый набор данных, размещенный на платформе Kaggle, включает сведения о здоровье 5 110 человек и 11 клинических признаков для прогнозирования инсульта. Однако исследователи обнаружили недостаточно пропусков в данных, что маловероятно для реальных медицинских исследований. Этот набор применялся в 104 публикациях, включая проекты из Индонезии и США. Его загрузил Федерико Сориано Паласиос из Мадрида, который указал, что данные предназначены только для образовательных целей.

Второй набор, содержащий информацию о 100 000 пациентах для прогнозирования диабета, также вызвал подозрения: показатели уровня глюкозы представлены всего 18 уникальными значениями, что невозможно с учетом реального разнообразия. Кроме того, были выявлены многочисленные дублирования. Этот набор использовался в 21 исследовании, но не применялся в клинической практике. Данные загрузил Мохаммед Мустафа из Индии, который не раскрыл источник из-за конфиденциальности.

Ученые предупреждают, что использование моделей, обученных на таких данных, может привести к ошибочным диагнозам и неправильным решениям в лечении. Журнал Scientific Reports уже отозвал три статьи, основанных на этих наборах. Представители Kaggle отказались комментировать ситуацию. Ранее сообщалось, что искусственный интеллект превосходит врачей в анализе сложных онкологических данных.