Наш путь обучения GigaChat 3.5
Сбербанк
Представители «Сбера» — GigaChat Text Pretrain Lead Валентин Мамедов и Head of ML GigaChat Text Евгений Косарев — рассказали на конференции Deep Tech Night о подходе к обучению линейки LLM GigaChat 3.5.
Спикеры описали основные этапы тренировки моделей и их нюансы. Они включают:
- предобучение (Pretrain). В презентации подчеркивается важность обучения модели с нуля;
- выравнивание поведения (Alignment) с применением метода обучения с подкреплением на основе проверяемых наград (Reinforcement Learning with Verifiable Rewards, RLVR) и дистилляции из набора нейросетей-«экспертов».
В презентации отдельно подчеркивается необходимость создания единого цикла («фабрики») продуктовых экспериментов.
165Дата добавления:08.09.2026
165Дата добавления:08.09.2026