ggml‑org टीम ने llama.cpp संस्करण b11489 जारी किया है। रिलीज़ नोट्स के मुताबिक, इस अपडेट में Q6_K वेट डीक्वांटाइज़ेशन तेज़ किया गया है—यह वह प्रक्रिया है जिसमें संपीड़ित मॉडल वेट को फिर से इस्तेमाल लायक संख्याओं में बदला जाता है—और अनरोलिंग फैक्टर दोगुना किया गया है। Apple Silicon, Intel macOS, iOS और Vulkan व CUDA बिल्ड समेत Ubuntu के कई कॉन्फ़िगरेशन के लिए अब पहले से तैयार बाइनरी उपलब्ध हैं।
यह क्यों मायने रखता है
डीक्वांटाइज़ेशन तेज़ होने से डेवलपर उसी हार्डवेयर पर LLM कम लेटेंसी के साथ चला सकते हैं।