На конференции Deep Tech Night лидер команды по ускорению инференса на NPU в SGLang в «Яндексе» Егор Филимонов разобрал процесс работы ИИ-ускорителей (Neural Processing Unit, NPU) Huawei Ascend.
В докладе он проанализировал, как исполняемые во время инференса LLM и CV-моделей задачи влияют на архитектуру решений и используемые фреймворки.
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.