संक्षिप्त · 1 मिनट पढ़ना
LlamAmpere v0.4 ने RTX 3090 पर 95+ टोकन प्रति सेकंड की रफ्तार दर्ज की
एक डेवलपर का कहना है कि Llama.cpp के इस फोर्क का नया संस्करण, एक RTX 3090 पर 262K-टोकन संदर्भ के साथ 27 अरब पैरामीटर वाला Qwen मॉडल चला सकता है। बताई गई रफ्तार 100,000 टोकन जनरेट होने तक बनी रही।
Oossa · Oossa के बारे में
डेवलपर JakeATX ने LlamAmpere का v0.4 जारी किया है। यह Llama.cpp का ऐसा फोर्क है जिसे Nvidia Ampere ग्राफिक्स कार्ड के लिए बेहतर बनाया गया है। Reddit पर एक पोस्ट में उन्होंने बताया कि एक RTX 3090 पर 27 अरब पैरामीटर वाले Qwen मॉडल से 100,000 टोकन जनरेट करते समय रफ्तार 95 टोकन प्रति सेकंड से अधिक रही।
परीक्षण में कंप्रेस्ड मॉडल और 262,144 टोकन की संदर्भ विंडो का इस्तेमाल किया गया। JakeATX के मुताबिक, v0.4 पिछले संस्करण की तुलना में करीब 10% तेज था और 10% से अधिक बड़ा संदर्भ संभाल सकता था। ये डेवलपर के बताए नतीजे हैं, किसी स्वतंत्र बेंचमार्क के नहीं।
यह क्यों मायने रखता है
अगर दूसरे उपयोगकर्ताओं के यहां भी ये नतीजे सही साबित होते हैं, तो इससे संकेत मिलता है कि एक पुराना ग्राफिक्स कार्ड भी लंबी टेक्स्ट जनरेशन प्रक्रिया को उपयोगी रफ्तार से चला सकता है।
स्रोत और संदर्भ
| # | स्रोत | प्रकाशक | तारीख | मुख्य बात |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28 सित॰ 2026 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 स्रोत
अंतिम अपडेट:
Oossa · न्यूज़लेटर
AI का हफ़्ता, आसान भाषा में
हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।