Oossa

llama.cpp में कई क्वांटाइज़्ड टाइप के लिए नया MMA kernel

Oct 7 2026 के अपडेट में metal kernel को BF16, Q-types और अन्य फॉर्मैट का सपोर्ट मिला है। इससे Apple M3 Ultra डिवाइस पर matrix-multiply तेज़ होता है।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

llama.cpp प्रोजेक्ट ने Oct 7 2026 को version b11476 जारी किया। इसमें एक सामान्य few-row MMA (matrix-multiply-accumulate) kernel जोड़ा गया है, जो BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 और कई IQ फॉर्मैट के साथ काम करता है। यह kernel अलग-अलग row counts पर सक्रिय होता है—TQ2_0 के लिए 5 rows, BF16 के लिए 4, MXFP4, Q2_0, Q2_K और IQ4_NL के लिए 3, और बाकी के लिए 2 rows—और Apple M3 Ultra पर पिछले kernels से बेहतर प्रदर्शन करता है। Benchmarks के मुताबिक, तय सीमा पर यह बदलाव ऑपरेशनों का समय 0.23 s से 0.98 s तक तेज़ करता है और rows की अन्य संख्याओं पर भी समय में सुधार करता है।

यह क्यों मायने रखता है

डेवलपर M3 Ultra चिप वाले Mac पर quantized Llama models तेज़ी से चला सकते हैं, जिससे ऐप्लिकेशनों में inference का समय घटेगा।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।