ggml‑org 团队于 2026-10-09 发布 llama.cpp b11527。此次更新将所有 WebGPU 操作切换为二维工作组调度,弃用旧的一维方式;同时推出适用于 macOS(Apple Silicon 和 Intel)、iOS 以及多个 Ubuntu 配置的新预编译二进制版本,其中包括 Vulkan 和 CUDA 构建版本。这些改动旨在提升浏览器中的 GPU 性能,并简化受支持设备上的安装配置。
为什么重要
开发者无需编写自定义内核代码,就能在支持 WebGPU 的浏览器中更快地运行大语言模型。