# LlamAmpere v0.4 haalt volgens melding meer dan 95 tokens per seconde op een RTX 3090

> Een ontwikkelaar zegt dat de nieuwste versie van de Llama.cpp-fork een Qwen-model met 27 miljard parameters en een context van 262K tokens op één RTX 3090 kan draaien. De gemelde snelheid bleef behouden tijdens het genereren van 100.000 tokens.

Oossa · 2026-09-28 · https://oossa.com/nl/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

Ontwikkelaar JakeATX heeft versie 0.4 van LlamAmpere uitgebracht, een fork van Llama.cpp die is geoptimaliseerd voor Nvidia Ampere-videokaarten. In een Reddit-bericht meldt die meer dan 95 tokens per seconde te hebben gehaald bij het genereren van 100.000 tokens met een Qwen-model van 27 miljard parameters op één RTX 3090.

Voor de test werd een gecomprimeerd model gebruikt, met een contextvenster van 262.144 tokens. JakeATX zegt dat v0.4 ongeveer 10% sneller was dan de vorige versie en een ruim 10% grotere context ondersteunde. Dit zijn resultaten die de ontwikkelaar zelf meldt, geen onafhankelijke benchmark.

## De feiten

- De gemelde configuratie gebruikte één Nvidia RTX 3090 en een context van 262.144 tokens.
- Volgens de ontwikkelaar is v0.4 ongeveer 10% sneller dan de vorige versie.

## Waarom het ertoe doet

Als de gemelde resultaten ook bij andere gebruikers standhouden, wijzen ze erop dat één oudere videokaart lange tekstgeneratiesessies op bruikbare snelheden aankan.

## Bronnen en referenties

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

Laatst bijgewerkt: 2026-09-28
