Il team ggml‑org ha rilasciato llama.cpp versione b11527 il 2026-10-09. L’aggiornamento passa a una distribuzione 2D dei gruppi di lavoro per tutte le operazioni WebGPU, eliminando il precedente metodo 1D. Include inoltre nuovi binari precompilati per macOS (Apple Silicon e Intel), iOS e diverse configurazioni di Ubuntu, comprese build Vulkan e CUDA. Le modifiche puntano a migliorare la fluidità delle prestazioni GPU nei browser e a semplificare la configurazione sui dispositivi supportati.
Perché conta
Gli sviluppatori possono eseguire LLM più velocemente nei browser compatibili con WebGPU, senza scrivere codice personalizzato per i kernel.