Группа исследователей под руководством Адриана Барнетта из Квинслендского технологического университета выявила, что десятки моделей искусственного интеллекта, применяемых для оценки риска инсульта и диабета, обучались на данных с неясным и сомнительным происхождением. В научном журнале Nature сообщается, что команда проанализировала 124 рецензируемых исследования, использующих два общедоступных медицинских набора данных.
Первый набор, предназначенный для прогнозирования инсульта и размещённый на платформе Kaggle, содержит сведения о здоровье 5 110 человек, включая историю сердечных заболеваний, семейное положение, уровень глюкозы и индекс массы тела. Однако учёные отметили подозрительное отсутствие пропусков в данных, что нехарактерно для реальных клинических исследований, где всегда встречаются неполные данные из-за разных причин. Этот набор использовался в 104 проектах, включая медицинские учреждения Индонезии и США. Он был загружен специалистом из Мадрида Федерико Сориано Паласиосом, который указал, что данные получены из конфиденциального источника и должны применяться исключительно в образовательных целях.
Второй набор для прогнозирования диабета содержит информацию о 100 000 человек, включая индекс массы тела, историю курения и уровень глюкозы. Здесь выявлены серьёзные аномалии: всего 18 уникальных значений уровня глюкозы на всех участников, что невозможно в реальной выборке, а также многочисленные дублирующие записи. Этот набор использовался в 21 исследовании, но пока не применялся в клинической практике. Его загрузил инженер из Индии Мохаммед Мустафа, который сообщил, что данные взяты из агрегированных электронных медицинских карт, но не раскрыл их источник из-за конфиденциальности.
Исследователи предупреждают, что использование подобных наборов данных для обучения моделей ИИ может привести к ошибочным диагнозам и неверным решениям в лечении. В связи с обнаруженными проблемами журнал Scientific Reports уже отозвал три статьи. Некоторые авторы объяснили, что использовали данные лишь для проверки алгоритмов, а не для клинических рекомендаций. Представители Kaggle отказались комментировать ситуацию.
Ранее сообщалось, что ИИ превзошел врачей в анализе сложных онкологических данных, показывая потенциал технологий при использовании качественных данных.