Oossa

Ny teknik förbättrar kvantisering av LLM:er utan extra inferenskostnad

Forskare presenterar Distributionally Robust Quantization (DRQ), som finjusterar vikter efter kvantisering efter träning och förbättrar resultaten för flera metoder.

NotisAv Publicerad av Oossa: 1 min läsning

Ett team lett av Zhuo Sun har publicerat en metod kallad Distributionally Robust Quantization (DRQ) på arXiv. DRQ justerar heltalskoderna för kvantiserade vikter för att minimera den största rekonstruktionsförlusten över varierande aktiveringsfördelningar. Metoden används efter viktbaserad kvantisering efter träning och lämnar både kvantiseringsrutnätet och inferensoperatorerna oförändrade. Experiment visar att DRQ förbättrar modeller som redan kvantiserats med sex metoder, däribland AWQ, GPTQ och ParoQuant, för både täta LLM:er och LLM:er av typen mixture-of-experts.

Varför det spelar roll

Det gör det möjligt för utvecklare att driftsätta mindre och snabbare LLM:er med högre träffsäkerhet, utan att byta hårdvara eller lägga till någon belastning vid körning.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.