Notis · 1 min läsning
LlamAmpere v0.4 uppges nå över 95 token per sekund på ett RTX 3090
En utvecklare säger att den senaste versionen av Llama.cpp-forken kan köra en Qwen-modell med 27 miljarder parametrar och ett kontextfönster på 262K token på ett enda RTX 3090. Den uppgivna hastigheten höll i sig under genereringen av 100 000 token.
Oossa · Om Oossa
Utvecklaren JakeATX har släppt v0.4 av LlamAmpere, en fork av Llama.cpp som är optimerad för Nvidias Ampere-grafikkort. I ett inlägg på Reddit uppger utvecklaren en hastighet på över 95 token per sekund vid generering av 100 000 token med en Qwen-modell med 27 miljarder parametrar på ett enda RTX 3090.
Testet använde en komprimerad modell och ett kontextfönster på 262 144 token. JakeATX säger att v0.4 var ungefär 10 procent snabbare än den föregående versionen och stödde drygt 10 procent längre kontext. Det här är utvecklarens uppgifter, inte resultat från ett oberoende prestandatest.
Varför det spelar roll
Om resultaten stämmer även för andra användare tyder de på att ett enda äldre grafikkort kan hantera mycket långa textgenereringar i användbar hastighet.
Källor och referenser
| # | Källa | Utgivare | Datum | Kärnpunkt |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28 sep. 2026 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 källor
Senast uppdaterad:
Oossa · Nyhetsbrev
Veckans AI, förklarad
Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.