# llama.cpp کرنل MMA چندردیفه را برای انواع کوانتیزه اضافه کرد

> به‌روزرسانی ۷ اکتبر ۲۰۲۶، کرنل Metal را برای پشتیبانی از BF16، انواع Q و چند قالب دیگر گسترش می‌دهد و ضرب ماتریسی را در دستگاه‌های Apple M3 Ultra سریع‌تر می‌کند.

Oossa · 2026-10-07 · https://oossa.com/fa/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

پروژه llama.cpp نسخه b11476 را در ۷ اکتبر ۲۰۲۶ منتشر کرد. این نسخه یک کرنل عمومی MMA (ضرب و انباشت ماتریسی) چندردیفه اضافه می‌کند که با BF16، Q1_0، Q2_0، MXFP4، Q2_K، Q3_K، TQ2_0 و چند قالب IQ کار می‌کند. این کرنل در شمار ردیف‌های متفاوتی فعال می‌شود: ۵ ردیف برای TQ2_0، ۴ ردیف برای BF16، ۳ ردیف برای MXFP4، Q2_0، Q2_K و IQ4_NL و ۲ ردیف برای بقیه. در این حالت، عملکرد آن روی Apple M3 Ultra از کرنل‌های قبلی بهتر است. بنچمارک‌ها نشان می‌دهند این تغییر در آستانهٔ فعال‌شدن، زمان عملیات را از ۰٫۲۳ ثانیه به ۰٫۹۸ ثانیه می‌رساند و زمان اجرا را در محدوده‌های ردیفی دیگر نیز بهبود می‌دهد.

## حقایق

- نسخه b11476 در ۷ اکتبر ۲۰۲۶ منتشر شد («چهارشنبه ۷ اکتبر ۲۰۲۶، ساعت ۱۶:۵۵:۰۹ به وقت GMT+0200»).
- کرنل MMA چندردیفه اکنون از BF16، انواع Q، MXFP4 و انواع IQ پشتیبانی می‌کند و روی M3 Ultra سریع‌تر اجرا می‌شود.

## چرا مهم است

توسعه‌دهندگان می‌توانند مدل‌های Llama کوانتیزه را روی مک‌های مجهز به تراشه‌های M3 Ultra سریع‌تر اجرا کنند و زمان استنتاج برنامه‌ها را کاهش دهند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

آخرین به‌روزرسانی: 2026-10-07
