Новые линейки русскоязычных бенчмарков
Сбербанк
Исполнительный директор в «Сбере» Алена Феногенова представила на конференции AI R&D Day 2026 линейку из пяти русскоязычных бенчмарков для оценки современных моделей:
- LIBRA для проверки работы с длинным контекстом;
- MERA Reason для математических рассуждений;
- MERA Text 2.0 для испытаний языковые, культурные и прикладные навыки;
- RUMBA для проверки памяти между сессиями;
- Harness-bench-fast для тестирования работы в агентной обвязке (Harness).
Кроме того, спикер описал современные тренды в оценке ИИ-моделей.
74Дата добавления:02.10.2026
74Дата добавления:02.10.2026