Kısa haber · 1 dk okuma
LlamAmpere v0.4, RTX 3090’da saniyede 95’in üzerinde token üretiyor
Bir geliştirici, Llama.cpp’nin çatallanmış sürümünün en yeni versiyonunun 27 milyar parametreli bir Qwen modelini tek bir RTX 3090’da 262K tokenlık bağlamla çalıştırabildiğini söylüyor. Bildirilen hız, 100.000 token üretilirken de korundu.
Oossa · Oossa Hakkında
Geliştirici JakeATX, Nvidia Ampere ekran kartları için optimize edilmiş bir Llama.cpp çatallanması olan LlamAmpere’in v0.4 sürümünü yayımladı. JakeATX, Reddit’teki bir paylaşımında, tek bir RTX 3090’da 27 milyar parametreli bir Qwen modeliyle 100.000 token üretirken saniyede 95’in üzerinde token elde ettiğini bildiriyor.
Testte sıkıştırılmış bir model ve 262.144 token olarak ayarlanmış bir bağlam penceresi kullanıldı. JakeATX, v0.4’ün önceki sürümden yaklaşık yüzde 10 daha hızlı olduğunu ve yüzde 10’dan fazla daha geniş bağlamı desteklediğini söylüyor. Bunlar bağımsız bir kıyaslama testinin değil, geliştiricinin bildirdiği sonuçlar.
Neden önemli
Bildirilen sonuçlar diğer kullanıcılar tarafından da doğrulanırsa, tek bir eski nesil ekran kartının uzun metin üretim işlemlerini işe yarar hızlarda yürütebildiğine işaret ediyor.
Kaynaklar ve referanslar
| # | Kaynak | Yayın | Tarih | Ana fikir |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28 Eyl 2026 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 kaynak
Son güncelleme:
Oossa · Bülten
Yapay zekâda hafta, anlaşılır dille
Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.