Компания Neuro.net представила новый метод для синтеза речи. В нем большие языковые и диффузионные модели совместно генерируют голос, учитывая акустические особенности и контекст, делая звучание более естественным. Платформа вышла в общий доступ и может использоваться в рабочих сервисах.
Разработка предназначена для использования в голосовых ИИ-решениях. Отмечается, что бизнес сможет задавать характер звучания ИИ-агентов и встраивать синтез в свои сервисы через API. В потоковом режиме Neuro TTS (модель, используется в платформе) начинает передавать аудиоданные через 120 миллисекунд после поступления запроса. Это позволяет начать воспроизведение до завершения генерации всей реплики.
В апреле 2026 года «МегаФон» добавил в голосового ассистента «Ева» функцию распознавания синтезированного голоса.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.