Oossa

Neue Methode verbessert 4-Bit-Quantisierung von LLMs ohne Mehrkosten

Forscher schlagen Distributionally Robust Quantization (DRQ) vor, um Gewichte nach der Post-Training-Quantisierung zu verfeinern und die Leistung mehrerer Verfahren zu steigern.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Ein Team um Zhuo Sun hat auf arXiv eine Methode namens Distributionally Robust Quantization (DRQ) veröffentlicht. DRQ passt die ganzzahligen Codes quantisierter Gewichte so an, dass der Rekonstruktionsverlust im schlimmsten Fall über verschiedene Aktivierungsverteilungen hinweg minimiert wird. Das Verfahren kommt nach einer gewichtsseitigen Post-Training-Quantisierung zum Einsatz und lässt sowohl das Quantisierungsraster als auch die Inferenzoperatoren unverändert. In Experimenten verbessert DRQ Modelle, die bereits mit sechs Verfahren quantisiert wurden, darunter AWQ, GPTQ und ParoQuant – sowohl dichte LLMs als auch Mixture-of-Experts-Modelle.

Warum es wichtig ist

Entwickler können damit kleinere und schnellere LLMs mit höherer Genauigkeit einsetzen, ohne die Hardware zu ändern oder zusätzliche Laufzeitkosten in Kauf zu nehmen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.