«Сбер» представил отечественную ИИ-модель Kandinsky 6.0 Video для генерации видео с синхронной речью, музыкой и звуками окружения.
Звук генерируется в стандартном для стриминговых сервисов качестве 44 кГц, создание видео доступно в форматах SD, HD или Full HD. Максимальная длительность ролика со звуком составляет пять секунд.
Работа с моделью проходит в GigaChat через текстовое описание сцены со звуковым рядом или загрузку первого кадра. Референсы на незнакомые объекты из запроса Kandinsky 6.0 Video ищет самостоятельно.
Новая ИИ-модель точнее передает физику реального мира по сравнению с предыдущей версией. Модель выложена в Open Source под лицензией MIT, позволяющей интегрировать ее в продукты бесплатно.
Kandinsky 6.0 Video на платформе Hugging Face.
В сентябре 2026 года команда Kandinsky разработала надстройку Time Adapter для генеративных нейросетей, которая позволяет им «понимать» течение времени при формировании видеоряда.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.