Команда ggml‑org выпустила версию llama.cpp b11507 8 октября 2026 года. Обновление добавляет поддержку кэша смеси экспертов (MoE), который можно распределять между несколькими GPU. Благодаря этому разработчики могут запускать более крупные модели MoE, которым не хватило бы памяти одной видеокарты. В релиз также вошли новые бинарные пакеты для macOS, iOS и нескольких конфигураций Linux, включая поддержку CUDA 12.8.
Почему это важно
Теперь разработчики могут запускать более крупные и мощные модели ИИ на системах с несколькими GPU, расширяя возможности персонального оборудования.