# LlamAmpere v0.4、RTX 3090で毎秒95トークン超を報告

> 開発者によると、Llama.cppのフォークの最新版は、単一のRTX 3090で、コンテキスト長262Kトークンの27億パラメーターQwenモデルを実行できるという。生成トークン数が10万に達するまで、報告された速度は維持された。

Oossa · 2026-09-28 · https://oossa.com/ja/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

開発者のJakeATXは、Nvidia Ampere世代のグラフィックスカード向けに最適化したLlama.cppのフォーク「LlamAmpere」のv0.4を公開した。Redditへの投稿によると、単一のRTX 3090で27億パラメーターのQwenモデルを使い、10万トークンを生成した際、毎秒95トークンを超える速度が出たという。

テストでは圧縮モデルを使い、コンテキストウィンドウを262,144トークンに設定した。JakeATXによると、v0.4は前バージョンより約10％高速で、コンテキスト長も10％以上増えたという。ただし、これは開発者が報告した結果であり、独立したベンチマークではない。

## 事実

- 報告されたテスト環境では、Nvidia RTX 3090を1枚使用し、コンテキスト長は262,144トークンだった。
- 開発者によると、v0.4は前バージョンより速度が約10％向上した。

## なぜ重要か

報告された結果がほかのユーザー環境でも再現されるなら、比較的古いグラフィックスカード1枚でも、非常に長いテキスト生成を実用的な速度で処理できる可能性を示している。

## 出典と参考資料

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

最終更新: 2026-09-28
