Инфраструктура RL-обучения
На конференции Deep Tech Night руководитель группы базовой ML-инфраструктуры «Яндекса» Иван Сапожков рассказал о принципах использования холдингом вычислительных мощностей для процесса обучения с подкреплением (Reinforcement Learning, RL) ИИ-моделей.
В своей презентации спикер описал место RL в общем процессе обучения, представил способы оптимизации вычислений. В качестве вызовов для инфраструктуры и при обучении моделей Сапожков выделил увеличение длины контекста моделей и ограничения при передаче данных.