# LlamAmpere v0.4 روی RTX 3090 به سرعت بیش از ۹۵ توکن در ثانیه می‌رسد

> یک توسعه‌دهنده می‌گوید تازه‌ترین نسخه از فورک Llama.cpp می‌تواند مدل Qwen با ۲۷ میلیارد پارامتر و پنجرهٔ زمینهٔ 262K توکنی را روی یک RTX 3090 اجرا کند. به‌گفتهٔ او، سرعت گزارش‌شده تا تولید ۱۰۰ هزار توکن حفظ شده است.

Oossa · 2026-09-28 · https://oossa.com/fa/llamampere-v0-4-reports-95-tokens-per-second-on-an-rtx-3090

توسعه‌دهنده‌ای با نام JakeATX نسخهٔ v0.4 از LlamAmpere را منتشر کرده است؛ فورکی از Llama.cpp که برای کارت‌های گرافیک Nvidia Ampere بهینه شده. او در پستی در Reddit گزارش داده که هنگام تولید ۱۰۰ هزار توکن با یک مدل Qwen دارای ۲۷ میلیارد پارامتر روی یک RTX 3090، سرعت به بیش از ۹۵ توکن در ثانیه رسیده است.

در این آزمایش از مدلی فشرده‌شده و پنجرهٔ زمینه‌ای با اندازهٔ 262,144 توکن استفاده شده است. JakeATX می‌گوید v0.4 حدود ۱۰ درصد سریع‌تر از نسخهٔ قبلی بوده و از بیش از ۱۰ درصد زمینهٔ بیشتر پشتیبانی کرده است؛ این ارقام نتایج اعلام‌شده از سوی توسعه‌دهنده‌اند و حاصل یک بنچمارک مستقل نیستند.

## حقایق

- در پیکربندی گزارش‌شده از یک Nvidia RTX 3090 و زمینه‌ای با اندازهٔ 262,144 توکن استفاده شده است.
- توسعه‌دهنده می‌گوید سرعت v0.4 در مقایسه با نسخهٔ قبلی حدود ۱۰ درصد افزایش یافته است.

## چرا مهم است

اگر نتایج گزارش‌شده برای کاربران دیگر هم تکرار شود، نشان می‌دهد یک کارت گرافیک قدیمی‌تر می‌تواند کارهای تولید متن بسیار طولانی را با سرعتی قابل‌استفاده انجام دهد.

## منابع و ارجاع‌ها

1. [95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090](https://www.reddit.com/r/LocalLLaMA/comments/1wsmtd4/95_tps_through_100k_generated_for_qwen38_27b_262k/) – Reddit r/LocalLLaMA, 2026-09-28

آخرین به‌روزرسانی: 2026-09-28
