ggml‑org выпустила llama.cpp версии b11462 2026‑10‑07. В обновлении привели в порядок буферы attention на базе SYCL — низкоуровневого интерфейса для графических вычислений. Также появились готовые сборки для macOS (Apple Silicon и Intel), iOS и нескольких вариантов Ubuntu: с поддержкой CPU, Vulkan и CUDA 12.8. Скачать сборки можно со страницы релиза на GitHub.
Почему это важно
Разработчики могут запускать llama.cpp локально на большем числе платформ без сборки из исходного кода и быстрее проводить эксперименты.