# LlamAmpere v0.4, RTX 3090’da saniyede 95’in üzerinde token üretiyor

> Bir geliştirici, Llama.cpp’nin çatallanmış sürümünün en yeni versiyonunun 27 milyar parametreli bir Qwen modelini tek bir RTX 3090’da 262K tokenlık bağlamla çalıştırabildiğini söylüyor. Bildirilen hız, 100.000 token üretilirken de korundu.

Oossa · 2026-09-28 · https://oossa.com/tr/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

Geliştirici JakeATX, Nvidia Ampere ekran kartları için optimize edilmiş bir Llama.cpp çatallanması olan LlamAmpere’in v0.4 sürümünü yayımladı. JakeATX, Reddit’teki bir paylaşımında, tek bir RTX 3090’da 27 milyar parametreli bir Qwen modeliyle 100.000 token üretirken saniyede 95’in üzerinde token elde ettiğini bildiriyor.

Testte sıkıştırılmış bir model ve 262.144 token olarak ayarlanmış bir bağlam penceresi kullanıldı. JakeATX, v0.4’ün önceki sürümden yaklaşık yüzde 10 daha hızlı olduğunu ve yüzde 10’dan fazla daha geniş bağlamı desteklediğini söylüyor. Bunlar bağımsız bir kıyaslama testinin değil, geliştiricinin bildirdiği sonuçlar.

## Gerçekler

- Bildirilen kurulumda tek bir Nvidia RTX 3090 ve 262.144 tokenlık bağlam kullanıldı.
- Geliştirici, v0.4’ün önceki sürüme kıyasla hızı yaklaşık yüzde 10 artırdığını söylüyor.

## Neden önemli

Bildirilen sonuçlar diğer kullanıcılar tarafından da doğrulanırsa, tek bir eski nesil ekran kartının uzun metin üretim işlemlerini işe yarar hızlarda yürütebildiğine işaret ediyor.

## Kaynaklar ve referanslar

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

Son güncelleme: 2026-09-28
