Oossa

Nieuwe techniek verbetert LLM-kwantisatie zonder extra rekenkosten

Onderzoekers introduceren Distributionally Robust Quantization (DRQ), een methode die gewichten na post-trainingkwantisatie verfijnt en de prestaties van verschillende technieken verbetert.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Een team onder leiding van Zhuo Sun heeft op arXiv een methode gepubliceerd met de naam Distributionally Robust Quantization (DRQ). DRQ past de integercodes van gekwantiseerde gewichten aan om het reconstructieverlies in het slechtste geval te minimaliseren bij uiteenlopende activatieverdelingen. De methode werkt na weight-only post-trainingkwantisatie en laat zowel het kwantisatierooster als de inferentie-operatoren ongemoeid. Uit experimenten blijkt dat DRQ modellen verbetert die al met zes methoden zijn gekwantiseerd, waaronder AWQ, GPTQ en ParoQuant. Dat geldt voor zowel dense LLM’s als mixture-of-experts-LLM’s.

Waarom het ertoe doet

Ontwikkelaars kunnen zo kleinere, snellere LLM’s met een hogere nauwkeurigheid inzetten, zonder de hardware aan te passen of extra rekenwerk tijdens gebruik toe te voegen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.