Авторы статьи в npj Digital Medicine разработали инструмент для выявления скрытых проблем в массивах данных, используемых для обучения медицинских ИИ. Они обращают внимание на то, что модели учатся делать выводы о клинических результатах на основе данных, на которых они обучаются. Во многих случаях это отлично работает, но может также приводить к ошибкам, которые не сразу заметны. Так, был разработан ИИ, обученный определять пол человека по глазам. Оказалось, что модель полагалась на наличие туши для ресниц, а не на какие-либо биологические признаки. Разработанный командой инструмент Generalized Attribute Utility and Detectability-Induced bias Testing (G-AUDIT) выявляет возможность подобных ошибочных ассоциаций. Исследователи протестировали его на различных медицинских данных, включая изображения, текст и электронные таблицы. G-AUDIT выявил скрытые недостатки в сборе данных, условиях визуализации и других элементах, которые могут привести к ошибочным выводам о состоянии здоровья пациента. Например, набор данных о раке кожи включал изображения из онкологической клиники, обслуживающей группу высокого риска, и изображения из общей дерматологической клиники, где регистрировалось меньше случаев рака. Поскольку качество систем визуализации в этих клиниках различалось, ИИ, обученный на этом наборе данных, мог ошибочно заключить, что качество камеры является ключевым фактором, предсказывающим рак. Или даже что наличие линеек на изображениях предсказывает рак, поскольку в онкологической клинике, как правило, использовали линейки для отслеживания размера новообразований с течением времени. Команда планирует продолжать развивать и расширять этот инструмент.

NatureDetecting dataset bias in medical AI using a generalized and modality agnostic auditing approach - npj Digital MedicineDespite many success stories along the path of Artificial Intelligence’s (AI) rise in healthcare, there are comparably many reports of significant shortcomings and unexpected behavior of AI in deployment. A major risk is AI’s reliance on association-based learning, where non-representative machine learning datasets can amplify latent bias during training and hide it during testing. To unlock new tools capable of detecting such AI bias issues, we present Generalized Attribute Utility and Detectability-Induced bias Testing (G-AUDIT). G-AUDIT is a data modality-agnostic dataset auditing approach that automatically quantifies shortcut learning risks by examining the interplay between task-level annotations, sensor-level measurements, and patient, environmental, and acquisition characteristics. We demonstrate the broad applicability of this method by analyzing a range of medical datasets across three distinct modalities (images, text, and tabular data) and machine learning tasks, successful