Oossa

llama.cpp b11494 发布,新增 CUDA warp 优化

开源库 Llama.cpp 现为每个 CUDA warp 分配 4 列 GDN 状态,提升 GPU 性能。

简讯作者: Oossa 发布日期: 1 分钟阅读

ggml‑org 团队发布了 llama.cpp b11494 版。此次更新将 CUDA 后端每个 warp 分配的 GDN 状态列数从 2 列改为 4 列,并将这一设置设为默认值。macOS(Apple Silicon 和 Intel)、iOS 以及多个 Ubuntu 版本的二进制文件现已开放下载。

为什么重要

使用 llama.cpp 在 NVIDIA GPU 上运行的开发者,无需修改代码即可获得更快的推理速度。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。