# llama.cpp ускорился на Mac благодаря flash attention для Metal

> 9 октября 2026 года вышли новые сборки LLM-рантайма с поддержкой flash attention 128/96 для Apple Silicon.

Oossa · 2026-10-09 · https://oossa.com/ru/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

Команда ggml-org обновила llama.cpp (релиз b11518) 9 октября 2026 года. В обновлении появились 128- и 96-битные ядра flash attention для Metal, которые ускоряют инференс на компьютерах Mac с Apple Silicon. Скачать можно готовые сборки для macOS (arm64), macOS на Intel, iOS и нескольких конфигураций Linux.

## Факты

- Релиз с тегом b11518 опубликован в пятницу, 9 октября 2026 года
- Добавлены ядра flash attention для Metal (128/96) для Apple Silicon

## Почему это важно

Пользователи устройств с Apple Silicon смогут запускать LLM быстрее, не покупая дополнительное GPU-оборудование.

## Источники и ссылки

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

Обновлено: 2026-10-09
