Команда ggml-org обновила llama.cpp (релиз b11518) 9 октября 2026 года. В обновлении появились 128- и 96-битные ядра flash attention для Metal, которые ускоряют инференс на компьютерах Mac с Apple Silicon. Скачать можно готовые сборки для macOS (arm64), macOS на Intel, iOS и нескольких конфигураций Linux.
Почему это важно
Пользователи устройств с Apple Silicon смогут запускать LLM быстрее, не покупая дополнительное GPU-оборудование.