Breve · 1 min di lettura
LlamAmpere v0.4 supera i 95 token al secondo su una RTX 3090
Uno sviluppatore afferma che l’ultima versione del fork di Llama.cpp può eseguire un modello Qwen da 27 miliardi di parametri con un contesto di 262K token su una sola RTX 3090. La velocità dichiarata si è mantenuta per tutti i 100.000 token generati.
Oossa · Informazioni su Oossa
Lo sviluppatore JakeATX ha pubblicato la versione v0.4 di LlamAmpere, un fork di Llama.cpp ottimizzato per le schede grafiche Nvidia Ampere. In un post su Reddit, riferisce di aver superato i 95 token al secondo generandone 100.000 con un modello Qwen da 27 miliardi di parametri su una sola RTX 3090.
Il test ha utilizzato un modello compresso e una finestra di contesto impostata a 262.144 token. JakeATX afferma che la v0.4 era circa il 10% più veloce della versione precedente e supportava un contesto superiore di oltre il 10%; si tratta dei risultati dichiarati dallo sviluppatore, non di un benchmark indipendente.
Perché conta
Se i risultati dichiarati saranno confermati anche da altri utenti, indicano che una singola scheda grafica non recente può gestire generazioni di testi molto lunghe a velocità utili.
Fonti e riferimenti
| # | Fonte | Testata | Data | Punto chiave |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28 set 2026 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 fonti
Ultimo aggiornamento:
Oossa · Newsletter
La settimana dell'IA, spiegata
Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.