# Новый метод улучшает квантование LLM без затрат на инференс

> Исследователи предложили Distributionally Robust Quantization (DRQ): метод уточняет веса после посттренировочного квантования и повышает эффективность нескольких существующих подходов.

Oossa · 2026-10-09 · https://oossa.com/ru/new-technique-improves-low-bit-llm-quantization-without-extra-inference-cost

Команда под руководством Чжуо Суня опубликовала на arXiv метод Distributionally Robust Quantization (DRQ). Он корректирует целочисленные коды квантованных весов, чтобы минимизировать наихудшую ошибку восстановления при разных распределениях активаций. DRQ применяется после посттренировочного квантования только весов и не меняет сетку квантования или операторы инференса. Эксперименты показали, что DRQ улучшает результаты моделей, квантованных шестью методами, в том числе AWQ, GPTQ и ParoQuant. Это относится и к плотным LLM, и к моделям со смесью экспертов.

## Факты

- Статья опубликована 2026-10-09 ("Fri Oct 09 2026")
- DRQ уточняет веса для шести существующих методов PTQ, включая AWQ, GPTQ и ParoQuant

## Почему это важно

Разработчики смогут развёртывать более компактные и быстрые LLM с высокой точностью, не меняя оборудование и не добавляя накладных расходов во время работы.

## Источники и ссылки

1. [When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization](https://arxiv.org/abs/2610.11226) – arXiv, 2026-10-09

Обновлено: 2026-10-09
