Ученые НИУ ВШЭ представили метод ProcrustesGPT для сжатия LLM. Они предложили использовать математические преобразования — вращение весов моделей. Это делает их более удобными для сжатия с помощью структурированных матриц — математических конструкций, которые занимают меньше памяти. В основе подхода лежит задача Прокруста, которая направлена на поиск лучшего ортогонального преобразования.
ProcrustesGPT не требует дообучения и может применяться к существующим моделям. Его протестировали на открытых решениях OPT и Llama2 (разработана Meta, которая признана экстремистской и запрещена в России). Объем LLM был уменьшен на 25–36%. Сжатые модели сохранили 90–95% первоначальной эффективности при генерации текста и решении логических задач. Метод в большинстве тестов оказался точнее других подходов, в том числе SliceGPT.
Специалисты Yandex Research, НИУ ВШЭ, а также Массачусетского технологического института (MIT) и других зарубежных университетов весной 2025 года представили метод квантизации HIGGS. Он позволяет сжимать нейросети без использования дополнительных данных и без вычислительно сложной оптимизации параметров.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.