# Una nuova tecnica migliora la quantizzazione degli LLM a pochi bit

> I ricercatori propongono la Distributionally Robust Quantization (DRQ), che affina i pesi dopo la quantizzazione post-training e migliora le prestazioni di diversi metodi.

Oossa · 2026-10-09 · https://oossa.com/it/new-technique-improves-low-bit-llm-quantization-without-extra-inference-cost

Un team guidato da Zhuo Sun ha pubblicato su arXiv un metodo chiamato Distributionally Robust Quantization (DRQ). DRQ modifica i codici interi dei pesi quantizzati per minimizzare l’errore di ricostruzione nel caso peggiore, considerando distribuzioni diverse delle attivazioni. Si applica dopo la quantizzazione post-training dei soli pesi e lascia invariati sia la griglia di quantizzazione sia gli operatori usati in inferenza. Gli esperimenti mostrano che DRQ migliora modelli già quantizzati con sei metodi, tra cui AWQ, GPTQ e ParoQuant, sia per gli LLM densi sia per quelli basati su mixture of experts.

## I fatti

- Articolo pubblicato il 2026-10-09 ("Fri Oct 09 2026")
- DRQ affina i pesi per sei metodi PTQ esistenti, tra cui AWQ, GPTQ e ParoQuant

## Perché conta

Consente agli sviluppatori di distribuire LLM più piccoli e veloci con una maggiore accuratezza, senza modificare l’hardware né aggiungere costi durante l’inferenza.

## Fonti e riferimenti

1. [When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization](https://arxiv.org/abs/2610.11226) – arXiv, 2026-10-09

Ultimo aggiornamento: 2026-10-09
