# LlamAmpere v0.4 ने RTX 3090 पर 95+ टोकन प्रति सेकंड की रफ्तार दर्ज की

> एक डेवलपर का कहना है कि Llama.cpp के इस फोर्क का नया संस्करण, एक RTX 3090 पर 262K-टोकन संदर्भ के साथ 27 अरब पैरामीटर वाला Qwen मॉडल चला सकता है। बताई गई रफ्तार 100,000 टोकन जनरेट होने तक बनी रही।

Oossa · 2026-09-28 · https://oossa.com/hi/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

डेवलपर JakeATX ने LlamAmpere का v0.4 जारी किया है। यह Llama.cpp का ऐसा फोर्क है जिसे Nvidia Ampere ग्राफिक्स कार्ड के लिए बेहतर बनाया गया है। Reddit पर एक पोस्ट में उन्होंने बताया कि एक RTX 3090 पर 27 अरब पैरामीटर वाले Qwen मॉडल से 100,000 टोकन जनरेट करते समय रफ्तार 95 टोकन प्रति सेकंड से अधिक रही।

परीक्षण में कंप्रेस्ड मॉडल और 262,144 टोकन की संदर्भ विंडो का इस्तेमाल किया गया। JakeATX के मुताबिक, v0.4 पिछले संस्करण की तुलना में करीब 10% तेज था और 10% से अधिक बड़ा संदर्भ संभाल सकता था। ये डेवलपर के बताए नतीजे हैं, किसी स्वतंत्र बेंचमार्क के नहीं।

## तथ्य

- बताए गए सेटअप में एक Nvidia RTX 3090 और 262,144 टोकन का संदर्भ इस्तेमाल किया गया।
- डेवलपर का कहना है कि v0.4 पिछले संस्करण के मुकाबले करीब 10% तेज था।

## यह क्यों मायने रखता है

अगर दूसरे उपयोगकर्ताओं के यहां भी ये नतीजे सही साबित होते हैं, तो इससे संकेत मिलता है कि एक पुराना ग्राफिक्स कार्ड भी लंबी टेक्स्ट जनरेशन प्रक्रिया को उपयोगी रफ्तार से चला सकता है।

## स्रोत और संदर्भ

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

अंतिम अपडेट: 2026-09-28
