Ein Team um Zhuo Sun hat auf arXiv eine Methode namens Distributionally Robust Quantization (DRQ) veröffentlicht. DRQ passt die ganzzahligen Codes quantisierter Gewichte so an, dass der Rekonstruktionsverlust im schlimmsten Fall über verschiedene Aktivierungsverteilungen hinweg minimiert wird. Das Verfahren kommt nach einer gewichtsseitigen Post-Training-Quantisierung zum Einsatz und lässt sowohl das Quantisierungsraster als auch die Inferenzoperatoren unverändert. In Experimenten verbessert DRQ Modelle, die bereits mit sechs Verfahren quantisiert wurden, darunter AWQ, GPTQ und ParoQuant – sowohl dichte LLMs als auch Mixture-of-Experts-Modelle.
Warum es wichtig ist
Entwickler können damit kleinere und schnellere LLMs mit höherer Genauigkeit einsetzen, ohne die Hardware zu ändern oder zusätzliche Laufzeitkosten in Kauf zu nehmen.