Команда ggml-org выпустила llama.cpp b11499 8 октября 2026 года. В обновлении бэкенд CUDA перевели на использование байтовых шагов для операции roll — теперь GPU корректно обрабатывает несмежные данные. В релиз также вошли новые сборки для Apple Silicon, компьютеров Mac с процессорами Intel, iOS и нескольких вариантов Ubuntu (CPU, Vulkan и CUDA 12). Все файлы можно скачать со страницы релиза на GitHub.
Почему это важно
Разработчики смогут запускать llama.cpp на большем числе конфигураций с GPU без ошибок, расширяя возможности локального использования LLM на настольных компьютерах и серверах.