Команда ggml-org выпустила llama.cpp версии b11527 2026-10-09. В обновлении для всех операций WebGPU применяется двумерная диспетчеризация рабочих групп вместо прежнего одномерного метода. Также в комплект вошли новые предварительно скомпилированные бинарные сборки для macOS (Apple Silicon и Intel), iOS и нескольких конфигураций Ubuntu, в том числе сборки с Vulkan и CUDA. Изменения призваны обеспечить более плавную работу GPU в браузерах и упростить настройку на поддерживаемых устройствах.
Почему это важно
Разработчики смогут быстрее запускать LLM в браузерах с поддержкой WebGPU, не создавая собственный код ядер.