OossaYapay zekâ hızla gelişiyor. Biz basitçe anlatıyoruz.
Bülten

Kısa haber · 1 dk okuma

LlamAmpere v0.4, RTX 3090’da saniyede 95’in üzerinde token üretiyor

Bir geliştirici, Llama.cpp’nin çatallanmış sürümünün en yeni versiyonunun 27 milyar parametreli bir Qwen modelini tek bir RTX 3090’da 262K tokenlık bağlamla çalıştırabildiğini söylüyor. Bildirilen hız, 100.000 token üretilirken de korundu.

Oossa · Oossa Hakkında

Geliştirici JakeATX, Nvidia Ampere ekran kartları için optimize edilmiş bir Llama.cpp çatallanması olan LlamAmpere’in v0.4 sürümünü yayımladı. JakeATX, Reddit’teki bir paylaşımında, tek bir RTX 3090’da 27 milyar parametreli bir Qwen modeliyle 100.000 token üretirken saniyede 95’in üzerinde token elde ettiğini bildiriyor.

Testte sıkıştırılmış bir model ve 262.144 token olarak ayarlanmış bir bağlam penceresi kullanıldı. JakeATX, v0.4’ün önceki sürümden yaklaşık yüzde 10 daha hızlı olduğunu ve yüzde 10’dan fazla daha geniş bağlamı desteklediğini söylüyor. Bunlar bağımsız bir kıyaslama testinin değil, geliştiricinin bildirdiği sonuçlar.

Neden önemli

Bildirilen sonuçlar diğer kullanıcılar tarafından da doğrulanırsa, tek bir eski nesil ekran kartının uzun metin üretim işlemlerini işe yarar hızlarda yürütebildiğine işaret ediyor.

Bu makale faydalı oldu mu?

Kaynaklar ve referanslar

#KaynakYayınTarihAna fikir
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA28 Eyl 2026Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 kaynak

Son güncelleme:

Oossallms.txt.md

Paylaş

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.

LlamAmpere v0.4, RTX 3090’da saniyede 95’in üzerinde token üretiyor – Oossa