OossaL'IA evolve in fretta. Noi la spieghiamo in modo semplice.
Newsletter

Breve · 1 min di lettura

LlamAmpere v0.4 supera i 95 token al secondo su una RTX 3090

Uno sviluppatore afferma che l’ultima versione del fork di Llama.cpp può eseguire un modello Qwen da 27 miliardi di parametri con un contesto di 262K token su una sola RTX 3090. La velocità dichiarata si è mantenuta per tutti i 100.000 token generati.

Oossa · Informazioni su Oossa

Lo sviluppatore JakeATX ha pubblicato la versione v0.4 di LlamAmpere, un fork di Llama.cpp ottimizzato per le schede grafiche Nvidia Ampere. In un post su Reddit, riferisce di aver superato i 95 token al secondo generandone 100.000 con un modello Qwen da 27 miliardi di parametri su una sola RTX 3090.

Il test ha utilizzato un modello compresso e una finestra di contesto impostata a 262.144 token. JakeATX afferma che la v0.4 era circa il 10% più veloce della versione precedente e supportava un contesto superiore di oltre il 10%; si tratta dei risultati dichiarati dallo sviluppatore, non di un benchmark indipendente.

Perché conta

Se i risultati dichiarati saranno confermati anche da altri utenti, indicano che una singola scheda grafica non recente può gestire generazioni di testi molto lunghe a velocità utili.

Questo articolo ti è stato utile?

Fonti e riferimenti

#FonteTestataDataPunto chiave
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA28 set 2026Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 fonti

Ultimo aggiornamento:

Oossallms.txt.md

Condividi

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.

LlamAmpere v0.4 supera i 95 token al secondo su una RTX 3090 – Oossa