Oossa

llama.cpp ускорил матричные вычисления на Apple M3 Ultra

Обновление от 7 октября 2026 года добавляет в Metal-ядро поддержку BF16, Q-форматов и других типов данных.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Проект llama.cpp выпустил версию b11476 7 октября 2026 года. В ней появилось универсальное ядро MMA (умножение матриц с накоплением) для небольшого числа строк. Оно поддерживает BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 и несколько форматов IQ. Ядро включается при разном числе строк: от 5 для TQ2_0 до 4 для BF16, 3 для MXFP4, Q2_0, Q2_K и IQ4_NL и 2 для остальных форматов. На Apple M3 Ultra оно работает быстрее прежних ядер. Согласно тестам, при достижении этих порогов операции ускоряются с 0,23 до 0,98 с, а время выполнения сокращается и при других диапазонах числа строк.

Почему это важно

Разработчики смогут быстрее запускать квантованные модели Llama на компьютерах Mac с чипами M3 Ultra, сокращая время инференса в приложениях.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.