OossaAI ontwikkelt zich snel. Wij leggen het eenvoudig uit.
Nieuwsbrief

Kort bericht · 1 min lezen

LlamAmpere v0.4 haalt volgens melding meer dan 95 tokens per seconde op een RTX 3090

Een ontwikkelaar zegt dat de nieuwste versie van de Llama.cpp-fork een Qwen-model met 27 miljard parameters en een context van 262K tokens op één RTX 3090 kan draaien. De gemelde snelheid bleef behouden tijdens het genereren van 100.000 tokens.

Oossa · Over Oossa

Ontwikkelaar JakeATX heeft versie 0.4 van LlamAmpere uitgebracht, een fork van Llama.cpp die is geoptimaliseerd voor Nvidia Ampere-videokaarten. In een Reddit-bericht meldt die meer dan 95 tokens per seconde te hebben gehaald bij het genereren van 100.000 tokens met een Qwen-model van 27 miljard parameters op één RTX 3090.

Voor de test werd een gecomprimeerd model gebruikt, met een contextvenster van 262.144 tokens. JakeATX zegt dat v0.4 ongeveer 10% sneller was dan de vorige versie en een ruim 10% grotere context ondersteunde. Dit zijn resultaten die de ontwikkelaar zelf meldt, geen onafhankelijke benchmark.

Waarom het ertoe doet

Als de gemelde resultaten ook bij andere gebruikers standhouden, wijzen ze erop dat één oudere videokaart lange tekstgeneratiesessies op bruikbare snelheden aankan.

Was dit artikel nuttig?

Bronnen en referenties

#BronMediumDatumKernpunt
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA28 sep 2026Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 bronnen

Laatst bijgewerkt:

Oossallms.txt.md

Delen

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.

LlamAmpere v0.4 haalt volgens melding meer dan 95 tokens per seconde op een RTX 3090 – Oossa