OossaAI utvecklas fort. Vi förklarar det enkelt.
Nyhetsbrev

Notis · 1 min läsning

LlamAmpere v0.4 uppges nå över 95 token per sekund på ett RTX 3090

En utvecklare säger att den senaste versionen av Llama.cpp-forken kan köra en Qwen-modell med 27 miljarder parametrar och ett kontextfönster på 262K token på ett enda RTX 3090. Den uppgivna hastigheten höll i sig under genereringen av 100 000 token.

Oossa · Om Oossa

Utvecklaren JakeATX har släppt v0.4 av LlamAmpere, en fork av Llama.cpp som är optimerad för Nvidias Ampere-grafikkort. I ett inlägg på Reddit uppger utvecklaren en hastighet på över 95 token per sekund vid generering av 100 000 token med en Qwen-modell med 27 miljarder parametrar på ett enda RTX 3090.

Testet använde en komprimerad modell och ett kontextfönster på 262 144 token. JakeATX säger att v0.4 var ungefär 10 procent snabbare än den föregående versionen och stödde drygt 10 procent längre kontext. Det här är utvecklarens uppgifter, inte resultat från ett oberoende prestandatest.

Varför det spelar roll

Om resultaten stämmer även för andra användare tyder de på att ett enda äldre grafikkort kan hantera mycket långa textgenereringar i användbar hastighet.

Var den här artikeln användbar?

Källor och referenser

#KällaUtgivareDatumKärnpunkt
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA28 sep. 2026Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 källor

Senast uppdaterad:

Oossallms.txt.md

Dela

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.

LlamAmpere v0.4 uppges nå över 95 token per sekund på ett RTX 3090 – Oossa