Oossa

Une technique améliore la quantification basse précision des LLM sans surcoût à l’inférence

Des chercheurs proposent la Distributionally Robust Quantization (DRQ), qui affine les poids après une quantification post-entraînement et améliore les performances de plusieurs méthodes.

BrèvePar Publié par Oossa: 1 min de lecture

Une équipe dirigée par Zhuo Sun a publié sur arXiv une méthode appelée Distributionally Robust Quantization (DRQ). Celle-ci ajuste les codes entiers des poids quantifiés afin de minimiser la perte de reconstruction dans le pire des cas, pour différentes distributions d’activations. Elle intervient après une quantification post-entraînement des poids uniquement, sans modifier la grille de quantification ni les opérateurs utilisés à l’inférence. Les expériences montrent que DRQ améliore les modèles déjà quantifiés avec six méthodes, dont AWQ, GPTQ et ParoQuant, qu’il s’agisse de LLM denses ou à mélange d’experts.

Pourquoi c'est important

Les développeurs peuvent ainsi déployer des LLM plus petits et plus rapides, avec une meilleure précision, sans changer de matériel ni ajouter de surcoût à l’exécution.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.