Команда Kandinsky разработала легковесную надстройку Time Adapter для генеративных нейросетей, которая управляет динамикой событий и частотой кадров в ролике и позволяет «понимать» течение времени при формировании видеоряда. Ожидается, что она также позволит использовать ГенИИ для генерации физически достоверных синтетических данных с целью обучения физического искусственного интеллекта.
По словам ученых, существующие системы при генерации видео не всегда правильно передают скорость происходящих событий. Это связано с особенностями в архитектуре моделей и тем, что при их обучении приоритет отдается эстетике отдельного кадра, а не физической достоверности.
Надстройка подключается к готовой нейросети и состоит из двух независимых блоков. Один из них управляет частотой кадров, а второй — динамикой происходящего в каждый момент сцены. Для обучения задействовали набор из 40 тыс. видеороликов с разной частотой и динамикой, в число которых входили как динамичные сцены с людьми, так и различные медленные природные процессы.
Созданная система может работать в двух разных режимах. В одном из них надстройка подключается к уже обученной модели и делает движения на вырабатываемых ей видео более плавными. Во втором случае она дообучается вместе с нейросетью, благодаря чему они приобретают способность менять плавность движения и физику сцены.
Разработку протестировали на моделях Kandinsky 5.0 Video Lite и Wan2.2. Замеры показали повышение естественности движений на 29%, улучшение визуального качества на 8% и повышение соответствия видео текстовому запросу на 19%.
В августе «Сбер» выпустил семейство генеративных моделей Kandinsky WM 1.0 для обучения физического ИИ.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.