Un team guidato da Zhuo Sun ha pubblicato su arXiv un metodo chiamato Distributionally Robust Quantization (DRQ). DRQ modifica i codici interi dei pesi quantizzati per minimizzare l’errore di ricostruzione nel caso peggiore, considerando distribuzioni diverse delle attivazioni. Si applica dopo la quantizzazione post-training dei soli pesi e lascia invariati sia la griglia di quantizzazione sia gli operatori usati in inferenza. Gli esperimenti mostrano che DRQ migliora modelli già quantizzati con sei metodi, tra cui AWQ, GPTQ e ParoQuant, sia per gli LLM densi sia per quelli basati su mixture of experts.
Perché conta
Consente agli sviluppatori di distribuire LLM più piccoli e veloci con una maggiore accuratezza, senza modificare l’hardware né aggiungere costi durante l’inferenza.