Команда разработчиков MERA выпустила обновленный бенчмарк MERA Text 2.0 для проверки фундаментальных текстовых языковых моделей. Он теперь состоит из четырех групп задач: человекоцентричность (Human-Centric), культурная специфика (Culture-Specific), агентные (Agentic) и рассуждения (Reasoning). В каждой категории по три теста.
Задачи в группе «Человекоцентричность» проверяют способности моделей в русскоязычных загадках, юморе и в понимании персонажа. В категории «Культурная специфика» оцениваются знание регионализмов, культурных особенностей и умение исправлять ошибки в тексте. Агентные способности проверяются в тестах на следование инструкциям, структурирование текстов и на базовое использование инструментов. В группе задач на рассуждения оцениваются работа с неоднозначностью, разбор структуры задачи и умение удерживать условия.
Как отмечают авторы, группа «Культурная специфика» демонстрирует наибольший потенциал для дальнейшего улучшения и при этом слабее других связана с общим уровнем модели.
Код запуска MERA Text 2.0 опубликован на GitHub, датасеты размещены на Hugging Face.
Команда MERA в ноябре 2025 года представила бенчмарк MERA Multi для мультимодальных моделей на русском языке.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.