Команда ggml‑org выпустила llama.cpp b11531. В релизе переработан API для чата и добавлены готовые сборки для macOS (Apple Silicon и Intel), iOS и нескольких вариантов Ubuntu, в том числе с поддержкой CPU, Vulkan и CUDA 12.8. Ссылки на скачивание доступны на странице релиза на GitHub. Теперь запускать LLM локально на большем числе платформ можно без самостоятельной компиляции.
Почему это важно
Разработчики могут запускать модели Llama локально на большем числе устройств, не тратя время на сборку, а в Ubuntu использовать ускорение GPU.