Oossaهوش مصنوعی به‌سرعت پیشرفت می‌کند. ما آن را ساده توضیح می‌دهیم.
خبرنامه

خبر کوتاه · 1 دقیقه مطالعه

LlamAmpere v0.4 روی RTX 3090 به سرعت بیش از ۹۵ توکن در ثانیه می‌رسد

یک توسعه‌دهنده می‌گوید تازه‌ترین نسخه از فورک Llama.cpp می‌تواند مدل Qwen با ۲۷ میلیارد پارامتر و پنجرهٔ زمینهٔ 262K توکنی را روی یک RTX 3090 اجرا کند. به‌گفتهٔ او، سرعت گزارش‌شده تا تولید ۱۰۰ هزار توکن حفظ شده است.

Oossa · درباره Oossa

توسعه‌دهنده‌ای با نام JakeATX نسخهٔ v0.4 از LlamAmpere را منتشر کرده است؛ فورکی از Llama.cpp که برای کارت‌های گرافیک Nvidia Ampere بهینه شده. او در پستی در Reddit گزارش داده که هنگام تولید ۱۰۰ هزار توکن با یک مدل Qwen دارای ۲۷ میلیارد پارامتر روی یک RTX 3090، سرعت به بیش از ۹۵ توکن در ثانیه رسیده است.

در این آزمایش از مدلی فشرده‌شده و پنجرهٔ زمینه‌ای با اندازهٔ 262,144 توکن استفاده شده است. JakeATX می‌گوید v0.4 حدود ۱۰ درصد سریع‌تر از نسخهٔ قبلی بوده و از بیش از ۱۰ درصد زمینهٔ بیشتر پشتیبانی کرده است؛ این ارقام نتایج اعلام‌شده از سوی توسعه‌دهنده‌اند و حاصل یک بنچمارک مستقل نیستند.

چرا مهم است

اگر نتایج گزارش‌شده برای کاربران دیگر هم تکرار شود، نشان می‌دهد یک کارت گرافیک قدیمی‌تر می‌تواند کارهای تولید متن بسیار طولانی را با سرعتی قابل‌استفاده انجام دهد.

آیا این مقاله مفید بود؟

منابع و ارجاع‌ها

#منبعرسانهتاریخنکته اصلی
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA۶ مهر ۱۴۰۵Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 منبع

آخرین به‌روزرسانی:

Oossallms.txt.md

اشتراک‌گذاری

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.

LlamAmpere v0.4 روی RTX 3090 به سرعت بیش از ۹۵ توکن در ثانیه می‌رسد – Oossa