# Une technique améliore la quantification basse précision des LLM sans surcoût à l’inférence

> Des chercheurs proposent la Distributionally Robust Quantization (DRQ), qui affine les poids après une quantification post-entraînement et améliore les performances de plusieurs méthodes.

Oossa · 2026-10-09 · https://oossa.com/fr/new-technique-improves-low-bit-llm-quantization-without-extra-inference-cost

Une équipe dirigée par Zhuo Sun a publié sur arXiv une méthode appelée Distributionally Robust Quantization (DRQ). Celle-ci ajuste les codes entiers des poids quantifiés afin de minimiser la perte de reconstruction dans le pire des cas, pour différentes distributions d’activations. Elle intervient après une quantification post-entraînement des poids uniquement, sans modifier la grille de quantification ni les opérateurs utilisés à l’inférence. Les expériences montrent que DRQ améliore les modèles déjà quantifiés avec six méthodes, dont AWQ, GPTQ et ParoQuant, qu’il s’agisse de LLM denses ou à mélange d’experts.

## Les faits

- Article publié le 2026-10-09 (« Fri Oct 09 2026 »)
- DRQ affine les poids de six méthodes PTQ existantes, dont AWQ, GPTQ et ParoQuant

## Pourquoi c'est important

Les développeurs peuvent ainsi déployer des LLM plus petits et plus rapides, avec une meilleure précision, sans changer de matériel ni ajouter de surcoût à l’exécution.

## Sources et références

1. [When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization](https://arxiv.org/abs/2610.11226) – arXiv, 2026-10-09

Dernière mise à jour: 2026-10-09
