llama.cpp प्रोजेक्ट ने Oct 7 2026 को version b11476 जारी किया। इसमें एक सामान्य few-row MMA (matrix-multiply-accumulate) kernel जोड़ा गया है, जो BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 और कई IQ फॉर्मैट के साथ काम करता है। यह kernel अलग-अलग row counts पर सक्रिय होता है—TQ2_0 के लिए 5 rows, BF16 के लिए 4, MXFP4, Q2_0, Q2_K और IQ4_NL के लिए 3, और बाकी के लिए 2 rows—और Apple M3 Ultra पर पिछले kernels से बेहतर प्रदर्शन करता है। Benchmarks के मुताबिक, तय सीमा पर यह बदलाव ऑपरेशनों का समय 0.23 s से 0.98 s तक तेज़ करता है और rows की अन्य संख्याओं पर भी समय में सुधार करता है।
यह क्यों मायने रखता है
डेवलपर M3 Ultra चिप वाले Mac पर quantized Llama models तेज़ी से चला सकते हैं, जिससे ऐप्लिकेशनों में inference का समय घटेगा।