A equipe ggml-org publicou o llama.cpp b11496 em 8 de outubro de 2026. A atualização adiciona uma etapa SYCL que transfere carregamentos em massa de modelos por meio de um buffer circular fixado na memória, acelerando o carregamento em GPUs compatíveis. Estão disponíveis para download binários para macOS (Apple Silicon e Intel), iOS e diversas versões do Ubuntu (CPU, Vulkan, CUDA 12).
Por que importa
Desenvolvedores podem carregar modelos de linguagem grandes mais rapidamente em hardware compatível com SYCL, reduzindo o tempo de inicialização de aplicativos que usam llama.cpp.