短信 · 1 分で読める
LlamAmpere v0.4、RTX 3090で毎秒95トークン超を報告
開発者によると、Llama.cppのフォークの最新版は、単一のRTX 3090で、コンテキスト長262Kトークンの27億パラメーターQwenモデルを実行できるという。生成トークン数が10万に達するまで、報告された速度は維持された。
Oossa · Oossaについて
開発者のJakeATXは、Nvidia Ampere世代のグラフィックスカード向けに最適化したLlama.cppのフォーク「LlamAmpere」のv0.4を公開した。Redditへの投稿によると、単一のRTX 3090で27億パラメーターのQwenモデルを使い、10万トークンを生成した際、毎秒95トークンを超える速度が出たという。
テストでは圧縮モデルを使い、コンテキストウィンドウを262,144トークンに設定した。JakeATXによると、v0.4は前バージョンより約10%高速で、コンテキスト長も10%以上増えたという。ただし、これは開発者が報告した結果であり、独立したベンチマークではない。
なぜ重要か
報告された結果がほかのユーザー環境でも再現されるなら、比較的古いグラフィックスカード1枚でも、非常に長いテキスト生成を実用的な速度で処理できる可能性を示している。
この記事は役に立ちましたか?
出典と参考資料
| # | 出典 | 媒体 | 日付 | 要点 |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 2026/09/28 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 件の出典
最終更新:
Oossa · ニュースレター
今週のAIを、わかりやすく
毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。