تیم ggml‑org نسخه b11527 از llama.cpp را در 2026-10-09 منتشر کرد. در این بهروزرسانی، همهٔ عملیات WebGPU به پردازش دوبعدی گروههای کاری منتقل شدهاند و روش قدیمی یکبعدی کنار گذاشته شده است. همچنین نسخههای تازهٔ ازپیشکامپایلشده برای macOS (Apple Silicon و Intel)، iOS و چند پیکربندی Ubuntu، از جمله نسخههای Vulkan و CUDA، ارائه شدهاند. این تغییرات با هدف روانتر شدن عملکرد GPU در مرورگرها و سادهتر شدن راهاندازی روی دستگاههای پشتیبانیشده انجام شدهاند.
چرا مهم است
توسعهدهندگان میتوانند بدون نوشتن کد کرنل سفارشی، مدلهای LLM را سریعتر در مرورگرهای سازگار با WebGPU اجرا کنند.