«Сбер» разработал и выложил в открытый доступ вариационный автоэнкодер KVAE-Audio для задачи токенизации (преобразования данных в математический формат) звука.
В основе модели лежит нейросеть DAC. KVAE-Audio обрабатывает полнодиапазонный звук с частотой 48 кГц.
Модель может сжимать аудиоданные по времени в 960 раз. Получаемое латентное пространство, где аудиоданные представлены в виде эмбеддингов (числовых векторов), состоит из 64 каналов. Исследователи также разработали подход к регуляризации пространства, за счет которого нейросеть может реконструировать звук с высокой точностью.
Посредством использования KVAE-Audio станет возможным обучать диффузионные модели с лучшей способностью генерировать звук и видео со звуком.
«Сбер» выпустил семейство токенизаторов KVAE-2.0 для моделей генерации изображений и видео в апреле 2026 года.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.