Как обрабатывать видео с помощью VLM и не потратить весь контекст
На конференции AI R&D Day 2026 руководитель направления Vision R&D в «Сбере» Никита Сидоров рассказал о способах оптимизации обработки видео VLM.
Спикер разобрал подходы DivPrune и HiPrune, за счет которых из кадров возможно удалить избыточные токены. Сидоров пояснил, что в используемом способе модель рассматривает видео как среду, к которой можно делать множественные обращения с помощью различных инструментов. Кроме того, он рассказал о варианте, при котором для вызовов инструментов используется агентская система.