Пять этапов проверки медицинского ИИ: как гарантировать безопасность диагностики
Знаете, что я всё чаще слышу от пациентов? «Врач в поликлинике использует программу, которая анализирует снимки», «Мне предложили пройти диагностику с помощью нейросети». Вопросов при этом больше, чем ответов: а насколько это точно? кто проверял?

Когда в клинике появляется ИИ: учёные предложили пять шагов для его проверки
а вдруг ошибка? Исследователи разработали стандартизированную пятиуровневую модель оценки алгоритмов искусственного интеллекта для здравоохранения. Система призвана проверять безопасность, диагностическую точность и этическую надёжность программного обеспечения до его интеграции в лечебные процессы. И хотя это пока концептуальная модель, а не утверждённый стандарт, давайте разберёмся шаг за шагом — что именно предлагается проверять и почему это важно для каждого из нас.
Из чего состоит пятиступенчатая проверка
На первом этапе алгоритм тестируют на данных нескольких медицинских центров одновременно. Это важно: модель должна работать корректно не только с пациентами из одной больницы, а с разными людьми, разными аппаратами, разными способами получения данных. Причём перед тестированием все параметры фиксируют — подкручивать настройки после проверки нельзя. Изменили что-то — считайте, что перед вами новая версия, и всю проверку нужно начинать заново.
Второй этап — «теневой» режим. Алгоритм получает реальные данные пациентов, но его результаты врачи не видят и не используют при принятии решений. По сути, система работает параллельно, и специалисты оценивают, насколько стабильно она функционирует, нет ли сбоев, как быстро обрабатывает информацию.
Третий этап касается уже взаимодействия врача и ИИ. Здесь важно понять не только то, насколько точно алгоритм ставит диагноз сам по себе, но и то, как его помощь влияет на работу специалиста. Есть нюанс, который учёные отдельно выделяют: риск так называемого автоматизационного смещения — когда врач начинает слишком доверять подсказке машины и может отказаться от своего изначально правильного решения. Нормально, что это звучит тревожно, но важно помнить: именно для того, чтобы такие риски выявить, эта стадия и существует.
Что проверяют на финальных этапах
Четвёртый этап — это уже полноценные проспективные исследования. Алгоритм работает с реальными пациентами, и врачи сравнивают результаты: стандартная помощь против помощи с использованием ИИ. Смотрят на точность диагностики, скорость работы, количество ненужных процедур, осложнения, повторные госпитализации. На этой стадии также оценивают экономическую целесообразность — выгодно ли это для системы здравоохранения в целом.
Пятый этап начинается после того, как система внедрена в обычную клиническую практику. Разработчики и медицинские организации должны продолжать отслеживать, как работает алгоритм в долгосрочной перспективе — в разных учреждениях, с разными группами пациентов. Если показатели начинают ухудшаться, предусмотрено возвращение на предыдущие этапы проверки, перенастройка или даже временная приостановка использования. И это, на мой взгляд, один из самых важных моментов: проверка не заканчивается в день запуска.
Отдельное российское исследование
Параллельно учёные из НИИ искусственного интеллекта AIRI и НМИЦ имени Алмазова разработали свою методику — для оценки качества диагностических рекомендаций нейросетей. В отличие от классических тестов, где алгоритм выбирает диагноз из готового списка, здесь модели формулировали ответ в свободной форме — как это происходит в реальном приёме. Тестировали шесть известных языковых моделей на 360 медицинских диалогах. По словам старшего научного сотрудника AIRI Ильи Копаничука, датасет и код исследования выложены в открытый доступ, поэтому методику можно использовать как эталонный показатель для оценки новых медицинских ИИ-систем.
Три модели оказались ближе всего к ответам врачей — GigaChat, DeepSeek и GPT-4o, опередив даже врачей в согласованности друг с другом на 13–16%. Все протестированные модели, кроме Llama 3.1 405B, показали результаты, достаточные для рассмотрения их в качестве потенциальных участников экспертной группы.
Что это значит для пациента
Давайте разберёмся практически. Если вам предлагают диагностику или консультацию с участием ИИ, вы имеете право спросить в клинике: на чём основан этот алгоритм, проходил ли он какие-то проверки, отслеживает ли учреждение его точность на постоянной основе. Пока пятиступенчатая система — это концептуальная модель, а не обязательный стандарт. Но сам факт, что такие рамки формулируются, говорит о том, что медицинское сообщество признаёт: просто выпустить программу в работу недостаточно.
Шаг за шагом мы приближаемся к тому, чтобы у пациента была не только надежда на технологии, но и понимание — как они проверены. А это уже немало.