Группа исследователей из Квинслендского технологического университета во главе со статистиком Адрианом Барнеттом обнаружила, что 124 научные статьи используют два общедоступных медицинских набора данных с неясным происхождением. Первый набор, предназначенный для прогнозирования инсульта и загруженный на платформу Kaggle, содержит данные о здоровье 5 110 человек, включая историю сердечных заболеваний, семейное положение, уровень глюкозы и индекс массы тела. Однако в нем почти отсутствуют пропуски, что вызывает сомнения, так как в реальных медицинских данных всегда встречаются пробелы из-за ухода участников или других причин. Этот набор применялся в 104 исследованиях, в том числе для больниц в Индонезии и США.
Второй набор данных ориентирован на прогнозирование диабета и включает информацию о 100 000 человек, но содержит лишь 18 уникальных значений уровня глюкозы в крови, что невозможно с учетом разнообразия пациентов. Также были выявлены многочисленные дублирующиеся записи. Этот набор использовали в 21 исследовании, однако в клинической практике он не применяется.
Загрузчики наборов утверждают, что данные взяты из конфиденциальных и агрегированных источников и предназначены для образовательных целей. Исследователи предупреждают, что использование моделей, обученных на таких сомнительных данных, может привести к ошибочным диагнозам и неправильным решениям в лечении. Журнал Scientific Reports уже отозвал три статьи, основанные на этих данных. Представители Kaggle отказались комментировать ситуацию.