ggml‑org टीम ने 29 सितंबर, 2026 को llama.cpp का b11262 संस्करण जारी किया। इस अपडेट में AVX512‑FP16 सपोर्ट जोड़ा गया है। यह आधी-प्रिसिजन (f16) डॉट प्रोडक्ट की गणना करता है, लेकिन बेहतर सटीकता के लिए नतीजों को सिंगल-प्रिसिजन (f32) में जोड़ता है। यह एक लो-लेवल बदलाव है, जो AVX512‑FP16 इंस्ट्रक्शन सेट वाले CPU पर इन्फरेंस को तेज़ करता है। इस रिलीज़ में macOS, iOS और Linux के कई बिल्ड के लिए नए बाइनरी भी शामिल हैं।
यह क्यों मायने रखता है
इससे डेवलपर आधुनिक CPU पर संख्यात्मक गुणवत्ता से समझौता किए बिना LLM तेज़ी से चला सकते हैं।