# Nova técnica melhora quantização de LLMs sem custo extra na inferência

> Pesquisadores propõem a Distributionally Robust Quantization (DRQ), que refina os pesos após a quantização pós-treinamento e melhora o desempenho de vários métodos.

Oossa · 2026-10-09 · https://oossa.com/pt/new-technique-improves-low-bit-llm-quantization-without-extra-inference-cost

Uma equipe liderada por Zhuo Sun publicou no arXiv um método chamado Distributionally Robust Quantization (DRQ). A DRQ ajusta os códigos inteiros dos pesos quantizados para minimizar a perda de reconstrução no pior caso, considerando diferentes distribuições de ativações. O método é aplicado após a quantização pós-treinamento apenas dos pesos e mantém inalterados a grade de quantização e os operadores de inferência. Os experimentos mostram que a DRQ melhora modelos já quantizados por seis métodos, como AWQ, GPTQ e ParoQuant, tanto em LLMs densos quanto em modelos de mistura de especialistas.

## Os fatos

- Artigo publicado em 2026-10-09 ("Fri Oct 09 2026")
- A DRQ refina os pesos de seis métodos de PTQ existentes, incluindo AWQ, GPTQ e ParoQuant

## Por que importa

A técnica permite que desenvolvedores implantem LLMs menores e mais rápidos com maior precisão, sem trocar o hardware nem adicionar custos durante a execução.

## Fontes e referências

1. [When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization](https://arxiv.org/abs/2610.11226) – arXiv, 2026-10-09

Última atualização: 2026-10-09
