ggml-org टीम ने 9 अक्टूबर 2026 को llama.cpp (रिलीज़ b11518) अपडेट किया। इस अपडेट में Metal के लिए 128-bit और 96-bit flash-attention kernels जोड़े गए हैं, जिससे Apple Silicon Mac पर इन्फ़रेंस तेज़ होता है। macOS (arm64), macOS Intel, iOS और Linux के कई कॉन्फ़िगरेशन के लिए पहले से तैयार बाइनरी डाउनलोड के लिए उपलब्ध हैं।
यह क्यों मायने रखता है
Apple Silicon इस्तेमाल करने वाले लोग अतिरिक्त GPU हार्डवेयर खरीदे बिना LLM तेज़ी से चला सकते हैं।