Oossa

Una nuova tecnica migliora la quantizzazione degli LLM a pochi bit

I ricercatori propongono la Distributionally Robust Quantization (DRQ), che affina i pesi dopo la quantizzazione post-training e migliora le prestazioni di diversi metodi.

BreveDi Pubblicato da Oossa: 1 min di lettura

Un team guidato da Zhuo Sun ha pubblicato su arXiv un metodo chiamato Distributionally Robust Quantization (DRQ). DRQ modifica i codici interi dei pesi quantizzati per minimizzare l’errore di ricostruzione nel caso peggiore, considerando distribuzioni diverse delle attivazioni. Si applica dopo la quantizzazione post-training dei soli pesi e lascia invariati sia la griglia di quantizzazione sia gli operatori usati in inferenza. Gli esperimenti mostrano che DRQ migliora modelli già quantizzati con sei metodi, tra cui AWQ, GPTQ e ParoQuant, sia per gli LLM densi sia per quelli basati su mixture of experts.

Perché conta

Consente agli sviluppatori di distribuire LLM più piccoli e veloci con una maggiore accuratezza, senza modificare l’hardware né aggiungere costi durante l’inferenza.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.