简讯 · 1 分钟阅读
LlamAmpere v0.4 在 RTX 3090 上实现每秒 95 个以上 token
一位开发者称,最新版本的 Llama.cpp 分支可在单张 RTX 3090 上运行拥有 270 亿参数、上下文长度达 262K token 的 Qwen 模型。据称,这一速度在生成 100,000 个 token 的过程中始终保持稳定。
Oossa · 关于 Oossa
开发者 JakeATX 发布了 LlamAmpere v0.4。这是一个针对 Nvidia Ampere 显卡优化的 Llama.cpp 分支。JakeATX 在 Reddit 帖文中称,在单张 RTX 3090 上运行一个拥有 270 亿参数的 Qwen 模型、生成 100,000 个 token 时,速度超过每秒 95 个 token。
测试使用了经过压缩的模型,并将上下文窗口设为 262,144 个 token。JakeATX 表示,v0.4 比上一版快约 10%,支持的上下文长度也增加了 10% 以上;这些是开发者报告的结果,并非独立基准测试。
为什么重要
如果其他用户也能复现这些结果,就说明一张较旧的显卡也能以实用的速度处理超长文本生成任务。
这篇文章有帮助吗?
来源与参考
| # | 来源 | 发布方 | 日期 | 要点 |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 2026年9月28日 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 个来源
最后更新:
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。