Kort bericht · 1 min lezen
LlamAmpere v0.4 haalt volgens melding meer dan 95 tokens per seconde op een RTX 3090
Een ontwikkelaar zegt dat de nieuwste versie van de Llama.cpp-fork een Qwen-model met 27 miljard parameters en een context van 262K tokens op één RTX 3090 kan draaien. De gemelde snelheid bleef behouden tijdens het genereren van 100.000 tokens.
Oossa · Over Oossa
Ontwikkelaar JakeATX heeft versie 0.4 van LlamAmpere uitgebracht, een fork van Llama.cpp die is geoptimaliseerd voor Nvidia Ampere-videokaarten. In een Reddit-bericht meldt die meer dan 95 tokens per seconde te hebben gehaald bij het genereren van 100.000 tokens met een Qwen-model van 27 miljard parameters op één RTX 3090.
Voor de test werd een gecomprimeerd model gebruikt, met een contextvenster van 262.144 tokens. JakeATX zegt dat v0.4 ongeveer 10% sneller was dan de vorige versie en een ruim 10% grotere context ondersteunde. Dit zijn resultaten die de ontwikkelaar zelf meldt, geen onafhankelijke benchmark.
Waarom het ertoe doet
Als de gemelde resultaten ook bij andere gebruikers standhouden, wijzen ze erop dat één oudere videokaart lange tekstgeneratiesessies op bruikbare snelheden aankan.
Bronnen en referenties
| # | Bron | Medium | Datum | Kernpunt |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28 sep 2026 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 bronnen
Laatst bijgewerkt:
Oossa · Nieuwsbrief
De AI-week, uitgelegd
Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.