ГлавнаяЛента

Российская газета

В AIRI и НМИЦ им. В.А. Алмазова разработали метрики RPAD и RRAD для оценки качества работы ИИ в медицинской диагностике

1 сентября, 12:00|
48

Ученые Института искусственного интеллекта AIRI и НМИЦ им. В.А. Алмазова представили новый подход для оценки качества работы систем искусственного интеллекта в медицинской диагностике. Метрики RPAD (Relative Precision of Algorithmic Diagnostics) и RRAD (Relative Recall of Algorithmic Diagnostics) сопоставляют результаты моделей с заключением группы врачей. Проверяется, как ИИ-решения формулируют ответ в свободной форме. В традиционных методах диагноз выбирается из заданного списка.

Исследователи собрали датасет из 1,5 тыс. пар диагнозов, чтобы корректно сопоставлять заключения, сделанные в свободной форме. Алгоритм на этом наборе данных показал точность сопоставления 98%.

Новый метод проверки протестировали с помощью 360 медицинских диалогов врачей с пациентами. Сравнивались GigaChat, Qwen, DeepSeek, GPT-4o, Mistral и Llamа (разработана Meta, которая признана экстремистской и запрещена в России). Все модели, кроме Llama 3.1 405B, оказались достаточно близки к мнению врачей, отмечают авторы. GigaChat, DeepSeek и GPT-4o показали лучшие результаты и оказались на 13–16% ближе к ответам специалистов, чем сами врачи друг к другу.

Исследование о метриках RPAD и RRAD опубликовано в журнале Scientific Reports, репозиторий размещен на Hugging Face.


В Институте AIRI в ноябре 2025 года представили бенчмарк STEPS для оценки языковых моделей в сложных химических задачах.


Подробнее

Расскажите знакомым:

Главное про цифровые технологии в Москве

Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности

Что такое ICT.Moscow?

ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.