Ученые Института искусственного интеллекта AIRI и НМИЦ им. В.А. Алмазова представили новый подход для оценки качества работы систем искусственного интеллекта в медицинской диагностике. Метрики RPAD (Relative Precision of Algorithmic Diagnostics) и RRAD (Relative Recall of Algorithmic Diagnostics) сопоставляют результаты моделей с заключением группы врачей. Проверяется, как ИИ-решения формулируют ответ в свободной форме. В традиционных методах диагноз выбирается из заданного списка.
Исследователи собрали датасет из 1,5 тыс. пар диагнозов, чтобы корректно сопоставлять заключения, сделанные в свободной форме. Алгоритм на этом наборе данных показал точность сопоставления 98%.
Новый метод проверки протестировали с помощью 360 медицинских диалогов врачей с пациентами. Сравнивались GigaChat, Qwen, DeepSeek, GPT-4o, Mistral и Llamа (разработана Meta, которая признана экстремистской и запрещена в России). Все модели, кроме Llama 3.1 405B, оказались достаточно близки к мнению врачей, отмечают авторы. GigaChat, DeepSeek и GPT-4o показали лучшие результаты и оказались на 13–16% ближе к ответам специалистов, чем сами врачи друг к другу.
Исследование о метриках RPAD и RRAD опубликовано в журнале Scientific Reports, репозиторий размещен на Hugging Face.
В Институте AIRI в ноябре 2025 года представили бенчмарк STEPS для оценки языковых моделей в сложных химических задачах.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.