ГлавнаяЛента

CNews

Ученые из AIRI представили бенчмарк для проверки рассуждений LLM

8 мая, 10:02|
274

Исследователи из Института искусственного интеллекта AIRI разработали бенчмарк MMReD для оценки способности LLM рассуждать в длинном контексте.

От LLM бенчмарк требует ответить на вопросы по переданной информации. В MMReD собраны 24 типа вопросов двух видов: требующие от модели вычленения конкретного факта и те, для ответа на которые необходимо проанализировать весь контекст.

Тестирование различных LLM на бенчмарке показало, что с ростом длины контекста качество ответов падало. По мнению исследователей, решить проблему возможно с использованием систем с рекуррентной памятью и более устойчивыми механизмами хранения информации.


В мае ученые из AIRI и НИУ ВШЭ создали бенчмарк ИИ-генерации белковых структур.


Подробнее

Расскажите знакомым:

Главное про цифровые технологии в Москве

Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности

Что такое ICT.Moscow?

ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.