ggml‑org टीम ने llama.cpp का संस्करण b11398 जारी किया है। इसमें x86 प्लेटफ़ॉर्म पर tinyBLAS CPU बैकएंड में BF16, FP16 और FP32 टेल प्रोसेसिंग का सपोर्ट जोड़ा गया है। तेज़ गणना के लिए इन टेल्स को वेक्टराइज़ भी किया गया है। macOS (Apple Silicon और Intel), iOS और Ubuntu के कई आर्किटेक्चर के लिए पहले से बने बाइनरी उपलब्ध कराए गए हैं। इस अपडेट में रेफरेंस इम्प्लीमेंटेशन के साथ तुलना की सटीकता सुनिश्चित करने के लिए टेस्ट में बदलाव भी शामिल हैं।
यह क्यों मायने रखता है
अब डेवलपर GPU के बिना, सामान्य CPU पर LLM इन्फ़रेंस तेज़ी से चला सकते हैं।