# Neue Methode verbessert 4-Bit-Quantisierung von LLMs ohne Mehrkosten

> Forscher schlagen Distributionally Robust Quantization (DRQ) vor, um Gewichte nach der Post-Training-Quantisierung zu verfeinern und die Leistung mehrerer Verfahren zu steigern.

Oossa · 2026-10-09 · https://oossa.com/de/new-technique-improves-low-bit-llm-quantization-without-extra-inference-cost

Ein Team um Zhuo Sun hat auf arXiv eine Methode namens Distributionally Robust Quantization (DRQ) veröffentlicht. DRQ passt die ganzzahligen Codes quantisierter Gewichte so an, dass der Rekonstruktionsverlust im schlimmsten Fall über verschiedene Aktivierungsverteilungen hinweg minimiert wird. Das Verfahren kommt nach einer gewichtsseitigen Post-Training-Quantisierung zum Einsatz und lässt sowohl das Quantisierungsraster als auch die Inferenzoperatoren unverändert. In Experimenten verbessert DRQ Modelle, die bereits mit sechs Verfahren quantisiert wurden, darunter AWQ, GPTQ und ParoQuant – sowohl dichte LLMs als auch Mixture-of-Experts-Modelle.

## Die Fakten

- Das Paper wurde am 2026-10-09 veröffentlicht („Fri Oct 09 2026“).
- DRQ verfeinert die Gewichte für sechs bestehende PTQ-Verfahren, darunter AWQ, GPTQ und ParoQuant.

## Warum es wichtig ist

Entwickler können damit kleinere und schnellere LLMs mit höherer Genauigkeit einsetzen, ohne die Hardware zu ändern oder zusätzliche Laufzeitkosten in Kauf zu nehmen.

## Quellen und Referenzen

1. [When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization](https://arxiv.org/abs/2610.11226) – arXiv, 2026-10-09

Zuletzt aktualisiert: 2026-10-09
