llama.cpp projesi, b11476 sürümünü 7 Ekim 2026’da yayımladı. Güncellemeyle BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 ve çeşitli IQ biçimleriyle çalışan genel amaçlı bir az satırlı MMA (matris çarpımı-birikimi) çekirdeği eklendi. Çekirdek, farklı satır sayılarında devreye giriyor: TQ2_0 için 5, BF16 için 4, MXFP4, Q2_0, Q2_K ve IQ4_NL için 3, diğerleri içinse 2 satırda. Apple M3 Ultra’da önceki çekirdeklerden daha yüksek performans sunuyor. Karşılaştırmalı testler, eşik değerinde işlemlerin süresinin 0,23 sn ile 0,98 sn arasında kısaldığını ve farklı satır sayılarında da sürelerin iyileştiğini gösteriyor.
Neden önemli
Geliştiriciler, M3 Ultra çipli Mac’lerde kuantize Llama modellerini daha hızlı çalıştırarak uygulamalardaki çıkarım süresini kısaltabilir.