Oossa

llama.cpp ускорился на Mac благодаря flash attention для Metal

9 октября 2026 года вышли новые сборки LLM-рантайма с поддержкой flash attention 128/96 для Apple Silicon.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда ggml-org обновила llama.cpp (релиз b11518) 9 октября 2026 года. В обновлении появились 128- и 96-битные ядра flash attention для Metal, которые ускоряют инференс на компьютерах Mac с Apple Silicon. Скачать можно готовые сборки для macOS (arm64), macOS на Intel, iOS и нескольких конфигураций Linux.

Почему это важно

Пользователи устройств с Apple Silicon смогут запускать LLM быстрее, не покупая дополнительное GPU-оборудование.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.