ggml‑org 团队于 2026‑10‑08 发布 llama.cpp b11498。此版本修复了一个 CUDA 内核问题:当某些张量维度超过 GPU 网格限制时,该问题会出现。此外,版本还附带了适用于 Apple Silicon、Intel macOS、iOS 和多种 Ubuntu 配置的新版预编译二进制文件,包括 CPU、Vulkan 和 CUDA 12.8 版本。
为什么重要
开发者现在可以在更多 GPU 配置上运行 llama.cpp,避免崩溃,并可获取适用于自身平台、开箱即用的二进制文件。