# llama.cpp ускорил матричные вычисления на Apple M3 Ultra

> Обновление от 7 октября 2026 года добавляет в Metal-ядро поддержку BF16, Q-форматов и других типов данных.

Oossa · 2026-10-07 · https://oossa.com/ru/llama-cpp-adds-few-row-mma-kernel-for-many-quantized-types

Проект llama.cpp выпустил версию b11476 7 октября 2026 года. В ней появилось универсальное ядро MMA (умножение матриц с накоплением) для небольшого числа строк. Оно поддерживает BF16, Q1_0, Q2_0, MXFP4, Q2_K, Q3_K, TQ2_0 и несколько форматов IQ. Ядро включается при разном числе строк: от 5 для TQ2_0 до 4 для BF16, 3 для MXFP4, Q2_0, Q2_K и IQ4_NL и 2 для остальных форматов. На Apple M3 Ultra оно работает быстрее прежних ядер. Согласно тестам, при достижении этих порогов операции ускоряются с 0,23 до 0,98 с, а время выполнения сокращается и при других диапазонах числа строк.

## Факты

- Версия b11476 вышла 7 октября 2026 года («Wed Oct 07 2026 16:55:09 GMT+0200»).
- Новое ядро MMA для небольшого числа строк поддерживает BF16, Q-форматы, MXFP4 и форматы IQ; на M3 Ultra оно работает быстрее.

## Почему это важно

Разработчики смогут быстрее запускать квантованные модели Llama на компьютерах Mac с чипами M3 Ultra, сокращая время инференса в приложениях.

## Источники и ссылки

1. [ggml-org/llama.cpp b11476](https://github.com/ggml-org/llama.cpp/releases/tag/b11476) – llama.cpp, 2026-10-07

Обновлено: 2026-10-07
