Бенчмарк состоит из 2,5 тыс. задач по 25 темам из курса школьной геометрии. Модели должны ответить на вопросы за один шаг без использования рассуждений.
Существующие тесты, как отмечают ученые, оценивают способность ИИ с помощью алгебраических вычислений и умения рассуждать. Ими нельзя оценить способность понимать пространственные взаимоотношения между объектами, без чего невозможен полноценный переход ИИ в физический мир. NoReGeo проверяет интуитивное геометрическое восприятие модели, например лежит ли точка внутри фигуры или пересекаются ли две прямые.
Ученые протестировали 45 ИИ-моделей: открытые и закрытые LLM, а также VLM. Максимальная точность составила 65%. Лучше всего с задачами справились Phi-3.5 Vision и GPT-4.1, хуже всего — DeepSeek и Llama (разработана Meta, которая признана экстремистской и запрещена в России).
Над тестом работали исследователи из Института искусственного интеллекта AIRI, МГУ им. М.В. Ломоносова, НИУ ВШЭ, Центрального университета, Университета Иннополиса и Applied AI Institute.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.