خبر کوتاه · 1 دقیقه مطالعه
LlamAmpere v0.4 روی RTX 3090 به سرعت بیش از ۹۵ توکن در ثانیه میرسد
یک توسعهدهنده میگوید تازهترین نسخه از فورک Llama.cpp میتواند مدل Qwen با ۲۷ میلیارد پارامتر و پنجرهٔ زمینهٔ 262K توکنی را روی یک RTX 3090 اجرا کند. بهگفتهٔ او، سرعت گزارششده تا تولید ۱۰۰ هزار توکن حفظ شده است.
Oossa · درباره Oossa
توسعهدهندهای با نام JakeATX نسخهٔ v0.4 از LlamAmpere را منتشر کرده است؛ فورکی از Llama.cpp که برای کارتهای گرافیک Nvidia Ampere بهینه شده. او در پستی در Reddit گزارش داده که هنگام تولید ۱۰۰ هزار توکن با یک مدل Qwen دارای ۲۷ میلیارد پارامتر روی یک RTX 3090، سرعت به بیش از ۹۵ توکن در ثانیه رسیده است.
در این آزمایش از مدلی فشردهشده و پنجرهٔ زمینهای با اندازهٔ 262,144 توکن استفاده شده است. JakeATX میگوید v0.4 حدود ۱۰ درصد سریعتر از نسخهٔ قبلی بوده و از بیش از ۱۰ درصد زمینهٔ بیشتر پشتیبانی کرده است؛ این ارقام نتایج اعلامشده از سوی توسعهدهندهاند و حاصل یک بنچمارک مستقل نیستند.
چرا مهم است
اگر نتایج گزارششده برای کاربران دیگر هم تکرار شود، نشان میدهد یک کارت گرافیک قدیمیتر میتواند کارهای تولید متن بسیار طولانی را با سرعتی قابلاستفاده انجام دهد.
منابع و ارجاعها
| # | منبع | رسانه | تاریخ | نکته اصلی |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | ۶ مهر ۱۴۰۵ | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 منبع
آخرین بهروزرسانی:
Oossa · خبرنامه
هفتهٔ هوش مصنوعی، به زبان ساده
هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.