پروژه llama.cpp نسخه b11476 را در ۷ اکتبر ۲۰۲۶ منتشر کرد. این نسخه یک کرنل عمومی MMA (ضرب و انباشت ماتریسی) چندردیفه اضافه میکند که با BF16، Q1_0، Q2_0، MXFP4، Q2_K، Q3_K، TQ2_0 و چند قالب IQ کار میکند. این کرنل در شمار ردیفهای متفاوتی فعال میشود: ۵ ردیف برای TQ2_0، ۴ ردیف برای BF16، ۳ ردیف برای MXFP4، Q2_0، Q2_K و IQ4_NL و ۲ ردیف برای بقیه. در این حالت، عملکرد آن روی Apple M3 Ultra از کرنلهای قبلی بهتر است. بنچمارکها نشان میدهند این تغییر در آستانهٔ فعالشدن، زمان عملیات را از ۰٫۲۳ ثانیه به ۰٫۹۸ ثانیه میرساند و زمان اجرا را در محدودههای ردیفی دیگر نیز بهبود میدهد.
چرا مهم است
توسعهدهندگان میتوانند مدلهای Llama کوانتیزه را روی مکهای مجهز به تراشههای M3 Ultra سریعتر اجرا کنند و زمان استنتاج برنامهها را کاهش دهند.