Oossa

Новый метод улучшает квантование LLM без затрат на инференс

Исследователи предложили Distributionally Robust Quantization (DRQ): метод уточняет веса после посттренировочного квантования и повышает эффективность нескольких существующих подходов.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда под руководством Чжуо Суня опубликовала на arXiv метод Distributionally Robust Quantization (DRQ). Он корректирует целочисленные коды квантованных весов, чтобы минимизировать наихудшую ошибку восстановления при разных распределениях активаций. DRQ применяется после посттренировочного квантования только весов и не меняет сетку квантования или операторы инференса. Эксперименты показали, что DRQ улучшает результаты моделей, квантованных шестью методами, в том числе AWQ, GPTQ и ParoQuant. Это относится и к плотным LLM, и к моделям со смесью экспертов.

Почему это важно

Разработчики смогут развёртывать более компактные и быстрые LLM с высокой точностью, не меняя оборудование и не добавляя накладных расходов во время работы.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.