OossaAI 发展迅速。我们用简单的话讲清楚。
新闻简报

简讯 · 1 分钟阅读

LlamAmpere v0.4 在 RTX 3090 上实现每秒 95 个以上 token

一位开发者称,最新版本的 Llama.cpp 分支可在单张 RTX 3090 上运行拥有 270 亿参数、上下文长度达 262K token 的 Qwen 模型。据称,这一速度在生成 100,000 个 token 的过程中始终保持稳定。

Oossa · 关于 Oossa

开发者 JakeATX 发布了 LlamAmpere v0.4。这是一个针对 Nvidia Ampere 显卡优化的 Llama.cpp 分支。JakeATX 在 Reddit 帖文中称,在单张 RTX 3090 上运行一个拥有 270 亿参数的 Qwen 模型、生成 100,000 个 token 时,速度超过每秒 95 个 token。

测试使用了经过压缩的模型,并将上下文窗口设为 262,144 个 token。JakeATX 表示,v0.4 比上一版快约 10%,支持的上下文长度也增加了 10% 以上;这些是开发者报告的结果,并非独立基准测试。

为什么重要

如果其他用户也能复现这些结果,就说明一张较旧的显卡也能以实用的速度处理超长文本生成任务。

这篇文章有帮助吗?

来源与参考

#来源发布方日期要点
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA2026年9月28日Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 个来源

最后更新:

Oossallms.txt.md

分享

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。