# LlamAmpere v0.4 atteint plus de 95 tokens par seconde sur une RTX 3090

> Un développeur affirme que la dernière version de ce fork de Llama.cpp peut exécuter un modèle Qwen de 27 milliards de paramètres avec un contexte de 262K tokens sur une seule RTX 3090. Selon lui, la vitesse annoncée s’est maintenue pendant la génération de 100 000 tokens.

Oossa · 2026-09-28 · https://oossa.com/fr/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

Le développeur JakeATX a publié la version v0.4 de LlamAmpere, un fork de Llama.cpp optimisé pour les cartes graphiques Nvidia Ampere. Dans une publication sur Reddit, il annonce un débit supérieur à 95 tokens par seconde lors de la génération de 100 000 tokens avec un modèle Qwen de 27 milliards de paramètres sur une seule RTX 3090.

Le test a utilisé un modèle compressé et une fenêtre de contexte réglée sur 262 144 tokens. JakeATX affirme que la version v0.4 était environ 10 % plus rapide que la précédente et prenait en charge un contexte de plus de 10 % supérieur ; il s’agit des résultats rapportés par le développeur, et non d’un benchmark indépendant.

## Les faits

- La configuration annoncée utilisait une seule Nvidia RTX 3090 et un contexte de 262 144 tokens.
- Le développeur affirme que la version v0.4 a amélioré la vitesse d’environ 10 % par rapport à la version précédente.

## Pourquoi c'est important

Si ces résultats se confirment chez d’autres utilisateurs, ils suggèrent qu’une seule carte graphique ancienne peut traiter de très longues générations de texte à une vitesse intéressante.

## Sources et références

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

Dernière mise à jour: 2026-09-28
