Сомнения в надежности данных ИИ для прогнозирования инсульта и диабета

Группа исследователей во главе с Адрианом Барнеттом из Квинслендского технологического университета обнаружила, что десятки моделей ИИ для прогнозирования инсульта и диабета основаны на данных сомнительного происхождения. В журнале Nature сообщается, что в ходе анализа 124 рецензируемых статей были выявлены два общедоступных набора медицинских данных с неясным источником.

Первый набор, загруженный на платформу Kaggle, содержит информацию о 5 110 пациентах, однако исследователи отметили, что в данных практически отсутствуют пропуски, что вызывает подозрения. Второй набор, посвященный диабету, включает данные о 100 000 человек, но количество уникальных значений глюкозы в крови оказалось крайне малым. Это ставит под сомнение надежность моделей, созданных на основе таких данных.

В результате Scientific Reports уже отозвал три статьи из-за недостоверности данных. Специалисты warn, что использование сомнительных наборов данных может привести к неверным диагнозам и решениям по лечению. Пресс-служба Kaggle не прокомментировала ситуацию.