Brève · 1 min de lecture
LlamAmpere v0.4 atteint plus de 95 tokens par seconde sur une RTX 3090
Un développeur affirme que la dernière version de ce fork de Llama.cpp peut exécuter un modèle Qwen de 27 milliards de paramètres avec un contexte de 262K tokens sur une seule RTX 3090. Selon lui, la vitesse annoncée s’est maintenue pendant la génération de 100 000 tokens.
Oossa · À propos d’Oossa
Le développeur JakeATX a publié la version v0.4 de LlamAmpere, un fork de Llama.cpp optimisé pour les cartes graphiques Nvidia Ampere. Dans une publication sur Reddit, il annonce un débit supérieur à 95 tokens par seconde lors de la génération de 100 000 tokens avec un modèle Qwen de 27 milliards de paramètres sur une seule RTX 3090.
Le test a utilisé un modèle compressé et une fenêtre de contexte réglée sur 262 144 tokens. JakeATX affirme que la version v0.4 était environ 10 % plus rapide que la précédente et prenait en charge un contexte de plus de 10 % supérieur ; il s’agit des résultats rapportés par le développeur, et non d’un benchmark indépendant.
Pourquoi c'est important
Si ces résultats se confirment chez d’autres utilisateurs, ils suggèrent qu’une seule carte graphique ancienne peut traiter de très longues générations de texte à une vitesse intéressante.
Sources et références
| # | Source | Média | Date | À retenir |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28 sept. 2026 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 sources
Dernière mise à jour:
Oossa · Newsletter
La semaine de l'IA, expliquée
Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.