Команда ggml-org выпустила llama.cpp версии b11540 10 октября 2026 года. Обновление добавляет поддержку SYCL, чтобы ускорить работу моделей «смесь экспертов» (MoE) с форматом MXFP4 за счёт арифметического декодирования и переупорядочивания весов. Также доступны готовые сборки для Apple Silicon и Intel на macOS, iOS и нескольких вариантов Ubuntu (CPU, Vulkan и CUDA). Список изменений опубликован на GitHub под тегом b11540.
Почему это важно
Разработчики смогут быстрее запускать более крупные модели MoE на GPU с поддержкой SYCL, а пользователям llama.cpp станет доступно больше вариантов оборудования.