# Ny teknik förbättrar kvantisering av LLM:er utan extra inferenskostnad

> Forskare presenterar Distributionally Robust Quantization (DRQ), som finjusterar vikter efter kvantisering efter träning och förbättrar resultaten för flera metoder.

Oossa · 2026-10-09 · https://oossa.com/sv/new-technique-improves-low-bit-llm-quantization-without-extra-inference-cost

Ett team lett av Zhuo Sun har publicerat en metod kallad Distributionally Robust Quantization (DRQ) på arXiv. DRQ justerar heltalskoderna för kvantiserade vikter för att minimera den största rekonstruktionsförlusten över varierande aktiveringsfördelningar. Metoden används efter viktbaserad kvantisering efter träning och lämnar både kvantiseringsrutnätet och inferensoperatorerna oförändrade. Experiment visar att DRQ förbättrar modeller som redan kvantiserats med sex metoder, däribland AWQ, GPTQ och ParoQuant, för både täta LLM:er och LLM:er av typen mixture-of-experts.

## Fakta

- Artikeln publicerades 2026-10-09 ("Fri Oct 09 2026")
- DRQ finjusterar vikter för sex befintliga PTQ-metoder, däribland AWQ, GPTQ och ParoQuant

## Varför det spelar roll

Det gör det möjligt för utvecklare att driftsätta mindre och snabbare LLM:er med högre träffsäkerhet, utan att byta hårdvara eller lägga till någon belastning vid körning.

## Källor och referenser

1. [When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization](https://arxiv.org/abs/2610.11226) – arXiv, 2026-10-09

Senast uppdaterad: 2026-10-09
