خبر موجز · 1 دقائق قراءة
LlamAmpere v0.4 يسجّل أكثر من 95 رمزًا في الثانية على RTX 3090
يقول مطوّر إن أحدث إصدار من نسخة Llama.cpp المعدّلة يستطيع تشغيل نموذج Qwen يضم 27 مليار مُعامل، مع سياق بحجم 262K رمزًا، على بطاقة RTX 3090 واحدة. ووفقًا للتقرير، حافظ الإصدار على هذه السرعة طوال توليد 100,000 رمز.
Oossa · عن Oossa
أصدر المطوّر JakeATX الإصدار v0.4 من LlamAmpere، وهي نسخة متفرعة من Llama.cpp ومهيّأة للعمل على بطاقات الرسوميات Nvidia Ampere. وفي منشور على Reddit، أفاد بتحقيق سرعة تتجاوز 95 رمزًا في الثانية أثناء توليد 100,000 رمز باستخدام نموذج Qwen يضم 27 مليار مُعامل على بطاقة RTX 3090 واحدة.
استخدم الاختبار نموذجًا مضغوطًا ونافذة سياق مضبوطة على 262,144 رمزًا. ويقول JakeATX إن الإصدار v0.4 أسرع بنحو 10% من الإصدار السابق، ويدعم سياقًا أكبر بأكثر من 10%؛ وهذه نتائج أبلغ عنها المطوّر وليست حصيلة اختبار معياري مستقل.
لماذا يهم
إذا تحققت هذه النتائج لدى مستخدمين آخرين، فهي تشير إلى أن بطاقة رسوميات واحدة من جيل أقدم قد تكون قادرة على التعامل مع عمليات توليد نصوص طويلة جدًا بسرعات عملية.
المصادر والمراجع
| # | المصدر | الجهة الناشرة | التاريخ | الخلاصة |
|---|---|---|---|---|
| 1 | 95+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗ | Reddit r/LocalLLaMA | 28/09/2026 | Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up |
1 مصادر
آخر تحديث:
Oossa · النشرة البريدية
أسبوع الذكاء الاصطناعي، مشروحًا
كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.