Ett team lett av Zhuo Sun har publicerat en metod kallad Distributionally Robust Quantization (DRQ) på arXiv. DRQ justerar heltalskoderna för kvantiserade vikter för att minimera den största rekonstruktionsförlusten över varierande aktiveringsfördelningar. Metoden används efter viktbaserad kvantisering efter träning och lämnar både kvantiseringsrutnätet och inferensoperatorerna oförändrade. Experiment visar att DRQ förbättrar modeller som redan kvantiserats med sex metoder, däribland AWQ, GPTQ och ParoQuant, för både täta LLM:er och LLM:er av typen mixture-of-experts.
Varför det spelar roll
Det gör det möjligt för utvecklare att driftsätta mindre och snabbare LLM:er med högre träffsäkerhet, utan att byta hårdvara eller lägga till någon belastning vid körning.