Проект ggml‑org/llama.cpp выпустил версию b11530 2026‑10‑09. Изменение сохраняет граф сэмплирования бэкенда статичным при обработке ubatch, поэтому его форма больше не меняется на этапах резервирования и декодирования. Это устраняет сбои, возникавшие при изменении топологии графа после его предварительного построения для резервирования. Исправление действует во всех указанных сборках — macOS, Linux, Android, Windows и openEuler — и для всех аппаратных бэкендов, включая CUDA, Vulkan и OpenCL.
Почему это важно
Разработчики, использующие llama.cpp, будут реже сталкиваться с ошибками во время выполнения при генерации нескольких выходных последовательностей на любом поддерживаемом CPU или GPU.