OossaL'IA évolue vite. Nous l'expliquons simplement.
Newsletter

Brève · 1 min de lecture

LlamAmpere v0.4 atteint plus de 95 tokens par seconde sur une RTX 3090

Un développeur affirme que la dernière version de ce fork de Llama.cpp peut exécuter un modèle Qwen de 27 milliards de paramètres avec un contexte de 262K tokens sur une seule RTX 3090. Selon lui, la vitesse annoncée s’est maintenue pendant la génération de 100 000 tokens.

Oossa · À propos d’Oossa

Le développeur JakeATX a publié la version v0.4 de LlamAmpere, un fork de Llama.cpp optimisé pour les cartes graphiques Nvidia Ampere. Dans une publication sur Reddit, il annonce un débit supérieur à 95 tokens par seconde lors de la génération de 100 000 tokens avec un modèle Qwen de 27 milliards de paramètres sur une seule RTX 3090.

Le test a utilisé un modèle compressé et une fenêtre de contexte réglée sur 262 144 tokens. JakeATX affirme que la version v0.4 était environ 10 % plus rapide que la précédente et prenait en charge un contexte de plus de 10 % supérieur ; il s’agit des résultats rapportés par le développeur, et non d’un benchmark indépendant.

Pourquoi c'est important

Si ces résultats se confirment chez d’autres utilisateurs, ils suggèrent qu’une seule carte graphique ancienne peut traiter de très longues générations de texte à une vitesse intéressante.

Cet article vous a-t-il été utile ?

Sources et références

#SourceMédiaDateÀ retenir
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA28 sept. 2026Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 sources

Dernière mise à jour:

Oossallms.txt.md

Partager

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.

LlamAmpere v0.4 atteint plus de 95 tokens par seconde sur une RTX 3090 – Oossa