A equipe ggml‑org lançou o llama.cpp versão b11527 em 2026-10-09. A atualização muda todas as operações WebGPU para o despacho de grupos de trabalho 2D, eliminando o método 1D anterior. Ela também inclui novos binários pré-compilados para macOS (Apple Silicon e Intel), iOS e várias configurações do Ubuntu, incluindo compilações para Vulkan e CUDA. As mudanças buscam melhorar o desempenho da GPU em navegadores e facilitar a instalação em dispositivos compatíveis.
Por que importa
Desenvolvedores podem executar LLMs com mais rapidez em navegadores compatíveis com WebGPU, sem precisar escrever código personalizado para kernels.