Команда под руководством Чжуо Суня опубликовала на arXiv метод Distributionally Robust Quantization (DRQ). Он корректирует целочисленные коды квантованных весов, чтобы минимизировать наихудшую ошибку восстановления при разных распределениях активаций. DRQ применяется после посттренировочного квантования только весов и не меняет сетку квантования или операторы инференса. Эксперименты показали, что DRQ улучшает результаты моделей, квантованных шестью методами, в том числе AWQ, GPTQ и ParoQuant. Это относится и к плотным LLM, и к моделям со смесью экспертов.
Почему это важно
Разработчики смогут развёртывать более компактные и быстрые LLM с высокой точностью, не меняя оборудование и не добавляя накладных расходов во время работы.