Команда ggml‑org выпустила llama.cpp версии b11493 8 октября 2026 года. Обновление добавляет реализацию grouped Mixture‑of‑Experts (MoE) XMX GEMM на SYCL — операции умножения матриц, используемой в больших языковых моделях. В релиз также вошли готовые сборки для macOS, iOS и Ubuntu (CPU, Vulkan и CUDA).
Почему это важно
Разработчики теперь могут запускать модели на архитектуре MoE на GPU с поддержкой SYCL, что расширяет выбор оборудования для рабочих нагрузок с открытыми большими языковыми моделями.