# LlamAmpere v0.4 supera i 95 token al secondo su una RTX 3090

> Uno sviluppatore afferma che l’ultima versione del fork di Llama.cpp può eseguire un modello Qwen da 27 miliardi di parametri con un contesto di 262K token su una sola RTX 3090. La velocità dichiarata si è mantenuta per tutti i 100.000 token generati.

Oossa · 2026-09-28 · https://oossa.com/it/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

Lo sviluppatore JakeATX ha pubblicato la versione v0.4 di LlamAmpere, un fork di Llama.cpp ottimizzato per le schede grafiche Nvidia Ampere. In un post su Reddit, riferisce di aver superato i 95 token al secondo generandone 100.000 con un modello Qwen da 27 miliardi di parametri su una sola RTX 3090.

Il test ha utilizzato un modello compresso e una finestra di contesto impostata a 262.144 token. JakeATX afferma che la v0.4 era circa il 10% più veloce della versione precedente e supportava un contesto superiore di oltre il 10%; si tratta dei risultati dichiarati dallo sviluppatore, non di un benchmark indipendente.

## I fatti

- La configurazione dichiarata utilizzava una sola Nvidia RTX 3090 e un contesto di 262.144 token.
- Lo sviluppatore afferma che la v0.4 ha migliorato la velocità di circa il 10% rispetto alla versione precedente.

## Perché conta

Se i risultati dichiarati saranno confermati anche da altri utenti, indicano che una singola scheda grafica non recente può gestire generazioni di testi molto lunghe a velocità utili.

## Fonti e riferimenti

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

Ultimo aggiornamento: 2026-09-28
