# llama.cpp में कई क्वांटाइज़्ड टाइप के लिए नया MMA kernel

> Oct 7 2026 के अपडेट में metal kernel को BF16, Q-types और अन्य फॉर्मैट का सपोर्ट मिला है। इससे Apple M3 Ultra डिवाइस पर matrix-multiply तेज़ होता है।

Oossa · 2026-10-07 · https://oossa.com/hi/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

llama.cpp प्रोजेक्ट ने Oct 7 2026 को version b11476 जारी किया। इसमें एक सामान्य few-row MMA (matrix-multiply-accumulate) kernel जोड़ा गया है, जो BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 और कई IQ फॉर्मैट के साथ काम करता है। यह kernel अलग-अलग row counts पर सक्रिय होता है—TQ2_0 के लिए 5 rows, BF16 के लिए 4, MXFP4, Q2_0, Q2_K और IQ4_NL के लिए 3, और बाकी के लिए 2 rows—और Apple M3 Ultra पर पिछले kernels से बेहतर प्रदर्शन करता है। Benchmarks के मुताबिक, तय सीमा पर यह बदलाव ऑपरेशनों का समय 0.23 s से 0.98 s तक तेज़ करता है और rows की अन्य संख्याओं पर भी समय में सुधार करता है।

## तथ्य

- Release b11476 प्रकाशित हुआ Oct 7 2026 को ("Wed Oct 07 2026 16:55:09 GMT+0200").
- Few-row MMA kernel अब BF16, Q-types, MXFP4 और IQ types को सपोर्ट करता है और M3 Ultra पर तेज़ चलता है।

## यह क्यों मायने रखता है

डेवलपर M3 Ultra चिप वाले Mac पर quantized Llama models तेज़ी से चला सकते हैं, जिससे ऐप्लिकेशनों में inference का समय घटेगा।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

अंतिम अपडेट: 2026-10-07
