Een team onder leiding van Zhuo Sun heeft op arXiv een methode gepubliceerd met de naam Distributionally Robust Quantization (DRQ). DRQ past de integercodes van gekwantiseerde gewichten aan om het reconstructieverlies in het slechtste geval te minimaliseren bij uiteenlopende activatieverdelingen. De methode werkt na weight-only post-trainingkwantisatie en laat zowel het kwantisatierooster als de inferentie-operatoren ongemoeid. Uit experimenten blijkt dat DRQ modellen verbetert die al met zes methoden zijn gekwantiseerd, waaronder AWQ, GPTQ en ParoQuant. Dat geldt voor zowel dense LLM’s als mixture-of-experts-LLM’s.
Waarom het ertoe doet
Ontwikkelaars kunnen zo kleinere, snellere LLM’s met een hogere nauwkeurigheid inzetten, zonder de hardware aan te passen of extra rekenwerk tijdens gebruik toe te voegen.