ggml‑org 团队发布了 llama.cpp b11494 版。此次更新将 CUDA 后端每个 warp 分配的 GDN 状态列数从 2 列改为 4 列,并将这一设置设为默认值。macOS(Apple Silicon 和 Intel)、iOS 以及多个 Ubuntu 版本的二进制文件现已开放下载。
为什么重要
使用 llama.cpp 在 NVIDIA GPU 上运行的开发者,无需修改代码即可获得更快的推理速度。
开源库 Llama.cpp 现为每个 CUDA warp 分配 4 列 GDN 状态,提升 GPU 性能。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
ggml‑org 团队发布了 llama.cpp b11494 版。此次更新将 CUDA 后端每个 warp 分配的 GDN 状态列数从 2 列改为 4 列,并将这一设置设为默认值。macOS(Apple Silicon 和 Intel)、iOS 以及多个 Ubuntu 版本的二进制文件现已开放下载。
使用 llama.cpp 在 NVIDIA GPU 上运行的开发者,无需修改代码即可获得更快的推理速度。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。