L’équipe ggml‑org a publié llama.cpp version b11527 le 2026-10-09. Cette mise à jour fait passer toutes les opérations WebGPU à une répartition des groupes de travail en 2D, abandonnant l’ancienne méthode en 1D. Elle comprend également de nouveaux binaires précompilés pour macOS (Apple Silicon et Intel), iOS et plusieurs configurations Ubuntu, avec notamment des versions Vulkan et CUDA. Ces changements visent à améliorer la fluidité des performances GPU dans les navigateurs et à simplifier l’installation sur les appareils compatibles.
Pourquoi c'est important
Les développeurs peuvent exécuter des LLM plus rapidement dans les navigateurs compatibles WebGPU, sans avoir à écrire de code de noyau personnalisé.