Проект llama.cpp выпустил версию b11476 7 октября 2026 года. В ней появилось универсальное ядро MMA (умножение матриц с накоплением) для небольшого числа строк. Оно поддерживает BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 и несколько форматов IQ. Ядро включается при разном числе строк: от 5 для TQ2_0 до 4 для BF16, 3 для MXFP4, Q2_0, Q2_K и IQ4_NL и 2 для остальных форматов. На Apple M3 Ultra оно работает быстрее прежних ядер. Согласно тестам, при достижении этих порогов операции ускоряются с 0,23 до 0,98 с, а время выполнения сокращается и при других диапазонах числа строк.
Почему это важно
Разработчики смогут быстрее запускать квантованные модели Llama на компьютерах Mac с чипами M3 Ultra, сокращая время инференса в приложениях.