Команда ggml‑org выпустила llama.cpp версии b11489. В обновлении ускорили деквантизацию весов Q6_K — преобразование сжатых весов модели обратно в числа, пригодные для использования, — и вдвое увеличили фактор развёртки циклов, говорится в примечаниях к выпуску. Теперь доступны готовые бинарные сборки для Apple Silicon, Intel macOS, iOS, а также нескольких конфигураций Ubuntu, включая сборки с Vulkan и CUDA.
Почему это важно
Благодаря более быстрой деквантизации разработчики смогут запускать LLM на том же оборудовании с меньшей задержкой.