Ученые MWS AI (входит в MTC Web Services), Университета ИТМО и Международного университета информационных технологий (IITU, Казахстан) разработали подход CallRewardRepeat для адаптации диалоговых систем к новым доменам. Исследователи предложили использовать для этого обучение с подкреплением GRPO. Работа направлена на быструю перенастройку чат-ботов и голосовых помощников на новые сценарии без необходимости собирать размеченные диалоги.
Обычно для решения задачи используют большие массивы данных или проприетарные модели, обучение строится на примерах правильных ответов. Ученые предложили вместо этого давать модели самой исследовать различные варианты решения и награждать ее за точный результат. Метод GRPO выбрали, потому что он не требует тяжелых дополнительных компонентов и его можно реализовать в сравнительно доступном вычислительном контуре, объяснили исследователи.
Эксперименты проводились на моделях от 1,5 млрд до 32 млрд параметров. Так, модель на 8 млрд параметров после обучения с использованием GRPO показала результат точности отслеживания 41,9%. У GPT-4 показатель составил 38,7%, у модели на 32 млрд параметров с классическим дообучением — 39,9%. То есть модель среднего размера превзошла GPT-4 и систему в четыре раза ее крупнее. При этом ее обучение проходило на данных из других моделей, а тестирование велось на новых сценариях.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.