# LlamAmpere v0.4 erreicht laut Angaben mehr als 95 Tokens pro Sekunde auf einer RTX 3090

> Ein Entwickler berichtet, dass die neueste Version des Llama.cpp-Forks ein Qwen-Modell mit 27 Milliarden Parametern und einem Kontext von 262K Tokens auf einer einzelnen RTX 3090 ausführen kann. Die angegebene Geschwindigkeit blieb auch bei der Generierung von 100.000 Tokens konstant.

Oossa · 2026-09-28 · https://oossa.com/de/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

Entwickler JakeATX hat v0.4 von LlamAmpere veröffentlicht, einem auf Nvidia-Ampere-Grafikkarten zugeschnittenen Fork von Llama.cpp. In einem Reddit-Beitrag berichtet JakeATX von mehr als 95 Tokens pro Sekunde bei der Generierung von 100.000 Tokens mit einem Qwen-Modell mit 27 Milliarden Parametern auf einer einzelnen RTX 3090.

Für den Test kam ein komprimiertes Modell mit einem auf 262.144 Tokens eingestellten Kontextfenster zum Einsatz. JakeATX zufolge war v0.4 rund 10 % schneller als die Vorgängerversion und unterstützte einen um mehr als 10 % größeren Kontext. Dabei handelt es sich um Angaben des Entwicklers, nicht um Ergebnisse eines unabhängigen Benchmarks.

## Die Fakten

- Laut den Angaben kam eine einzelne Nvidia RTX 3090 mit einem Kontext von 262.144 Tokens zum Einsatz.
- Der Entwickler gibt an, dass v0.4 im Vergleich zur Vorgängerversion rund 10 % schneller ist.

## Warum es wichtig ist

Sollten sich die gemeldeten Ergebnisse auch bei anderen Nutzern bestätigen, deutet das darauf hin, dass eine einzelne ältere Grafikkarte lange Textgenerierungen mit brauchbarer Geschwindigkeit bewältigen kann.

## Quellen und Referenzen

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

Zuletzt aktualisiert: 2026-09-28
