Как тренды в развитии нейросетей меняют архитектуру NPU и инференс-фреймворки
Яндекс
На конференции Deep Tech Night лидер команды по ускорению инференса на NPU в SGLang в «Яндексе» Егор Филимонов разобрал процесс работы ИИ-ускорителей (Neural Processing Unit, NPU) Huawei Ascend.
В докладе он проанализировал, как исполняемые во время инференса LLM и CV-моделей задачи влияют на архитектуру решений и используемые фреймворки.
97Дата добавления:07.09.2026
97Дата добавления:07.09.2026