ГлавнаяЛента

Хабр

Команда MERA представила новую версию бенчмарка MERA Text 2.0 для проверки фундаментальных текстовых языковых моделей

1 сентября, 11:17|
39

Команда разработчиков MERA выпустила обновленный бенчмарк MERA Text 2.0 для проверки фундаментальных текстовых языковых моделей. Он теперь состоит из четырех групп задач: человекоцентричность (Human-Centric), культурная специфика (Culture-Specific), агентные (Agentic) и рассуждения (Reasoning). В каждой категории по три теста.

Задачи в группе «Человекоцентричность» проверяют способности моделей в русскоязычных загадках, юморе и в понимании персонажа. В категории «Культурная специфика» оцениваются знание регионализмов, культурных особенностей и умение исправлять ошибки в тексте. Агентные способности проверяются в тестах на следование инструкциям, структурирование текстов и на базовое использование инструментов. В группе задач на рассуждения оцениваются работа с неоднозначностью, разбор структуры задачи и умение удерживать условия.

Как отмечают авторы, группа «Культурная специфика» демонстрирует наибольший потенциал для дальнейшего улучшения и при этом слабее других связана с общим уровнем модели.

Код запуска MERA Text 2.0 опубликован на GitHub, датасеты размещены на Hugging Face.


Команда MERA в ноябре 2025 года представила бенчмарк MERA Multi для мультимодальных моделей на русском языке.


Подробнее

Расскажите знакомым:

Главное про цифровые технологии в Москве

Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности

Что такое ICT.Moscow?

ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.