Zhuo Sun के नेतृत्व वाली एक टीम ने arXiv पर Distributionally Robust Quantization (DRQ) नाम की विधि जारी की। DRQ, क्वांटाइज़ किए गए वेट के इंटीजर कोड को इस तरह समायोजित करता है कि अलग-अलग ऐक्टिवेशन वितरणों में सबसे खराब स्थिति का रिकंस्ट्रक्शन लॉस कम से कम हो। यह केवल-वेट पोस्ट-ट्रेनिंग क्वांटाइज़ेशन के बाद काम करता है और क्वांटाइज़ेशन ग्रिड तथा इन्फरेंस ऑपरेटरों में कोई बदलाव नहीं करता। प्रयोगों से पता चलता है कि DRQ, AWQ, GPTQ और ParoQuant जैसे छह तरीकों से पहले ही क्वांटाइज़ किए गए मॉडल की परफॉर्मेंस बढ़ाता है। यह सुधार डेंस और मिक्सचर-ऑफ-एक्सपर्ट्स, दोनों तरह के LLM में दिखा।
यह क्यों मायने रखता है
इससे डेवलपर हार्डवेयर बदले बिना या रनटाइम पर अतिरिक्त बोझ डाले बिना, बेहतर सटीकता वाले छोटे और तेज़ LLM तैनात कर सकते हैं।