# LlamAmpere v0.4 在 RTX 3090 上实现每秒 95 个以上 token

> 一位开发者称，最新版本的 Llama.cpp 分支可在单张 RTX 3090 上运行拥有 270 亿参数、上下文长度达 262K token 的 Qwen 模型。据称，这一速度在生成 100,000 个 token 的过程中始终保持稳定。

Oossa · 2026-09-28 · https://oossa.com/zh/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

开发者 JakeATX 发布了 LlamAmpere v0.4。这是一个针对 Nvidia Ampere 显卡优化的 Llama.cpp 分支。JakeATX 在 Reddit 帖文中称，在单张 RTX 3090 上运行一个拥有 270 亿参数的 Qwen 模型、生成 100,000 个 token 时，速度超过每秒 95 个 token。

测试使用了经过压缩的模型，并将上下文窗口设为 262,144 个 token。JakeATX 表示，v0.4 比上一版快约 10%，支持的上下文长度也增加了 10% 以上；这些是开发者报告的结果，并非独立基准测试。

## 事实

- 据报告，该配置使用一张 Nvidia RTX 3090，上下文长度为 262,144 个 token。
- 开发者称，v0.4 的速度比上一版提升约 10%。

## 为什么重要

如果其他用户也能复现这些结果，就说明一张较旧的显卡也能以实用的速度处理超长文本生成任务。

## 来源与参考

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

最后更新: 2026-09-28
