Oossa

llama.cpp کرنل MMA چندردیفه را برای انواع کوانتیزه اضافه کرد

به‌روزرسانی ۷ اکتبر ۲۰۲۶، کرنل Metal را برای پشتیبانی از BF16، انواع Q و چند قالب دیگر گسترش می‌دهد و ضرب ماتریسی را در دستگاه‌های Apple M3 Ultra سریع‌تر می‌کند.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

پروژه llama.cpp نسخه b11476 را در ۷ اکتبر ۲۰۲۶ منتشر کرد. این نسخه یک کرنل عمومی MMA (ضرب و انباشت ماتریسی) چندردیفه اضافه می‌کند که با BF16، Q1_0، Q2_0، MXFP4، Q2_K، Q3_K، TQ2_0 و چند قالب IQ کار می‌کند. این کرنل در شمار ردیف‌های متفاوتی فعال می‌شود: ۵ ردیف برای TQ2_0، ۴ ردیف برای BF16، ۳ ردیف برای MXFP4، Q2_0، Q2_K و IQ4_NL و ۲ ردیف برای بقیه. در این حالت، عملکرد آن روی Apple M3 Ultra از کرنل‌های قبلی بهتر است. بنچمارک‌ها نشان می‌دهند این تغییر در آستانهٔ فعال‌شدن، زمان عملیات را از ۰٫۲۳ ثانیه به ۰٫۹۸ ثانیه می‌رساند و زمان اجرا را در محدوده‌های ردیفی دیگر نیز بهبود می‌دهد.

چرا مهم است

توسعه‌دهندگان می‌توانند مدل‌های Llama کوانتیزه را روی مک‌های مجهز به تراشه‌های M3 Ultra سریع‌تر اجرا کنند و زمان استنتاج برنامه‌ها را کاهش دهند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.