Oossaالذكاء الاصطناعي يتطور بسرعة. نحن نشرحه ببساطة.
النشرة البريدية

خبر موجز · 1 دقائق قراءة

LlamAmpere v0.4 يسجّل أكثر من 95 رمزًا في الثانية على RTX 3090

يقول مطوّر إن أحدث إصدار من نسخة Llama.cpp المعدّلة يستطيع تشغيل نموذج Qwen يضم 27 مليار مُعامل، مع سياق بحجم 262K رمزًا، على بطاقة RTX 3090 واحدة. ووفقًا للتقرير، حافظ الإصدار على هذه السرعة طوال توليد 100,000 رمز.

Oossa · عن Oossa

أصدر المطوّر JakeATX الإصدار v0.4 من LlamAmpere، وهي نسخة متفرعة من Llama.cpp ومهيّأة للعمل على بطاقات الرسوميات Nvidia Ampere. وفي منشور على Reddit، أفاد بتحقيق سرعة تتجاوز 95 رمزًا في الثانية أثناء توليد 100,000 رمز باستخدام نموذج Qwen يضم 27 مليار مُعامل على بطاقة RTX 3090 واحدة.

استخدم الاختبار نموذجًا مضغوطًا ونافذة سياق مضبوطة على 262,144 رمزًا. ويقول JakeATX إن الإصدار v0.4 أسرع بنحو 10% من الإصدار السابق، ويدعم سياقًا أكبر بأكثر من 10%؛ وهذه نتائج أبلغ عنها المطوّر وليست حصيلة اختبار معياري مستقل.

لماذا يهم

إذا تحققت هذه النتائج لدى مستخدمين آخرين، فهي تشير إلى أن بطاقة رسوميات واحدة من جيل أقدم قد تكون قادرة على التعامل مع عمليات توليد نصوص طويلة جدًا بسرعات عملية.

هل كان هذا المقال مفيدًا؟

المصادر والمراجع

#المصدرالجهة الناشرةالتاريخالخلاصة
195+ TPS through 100K generated for qwen3.8 27b, 262K ctx, on a single 3090 ↗Reddit r/LocalLLaMA28‏/09‏/2026Hello everyone! A little while back I posted about LlamAmpere, a fork of Llama.cpp with Ampere-specific improvements (though it is caught up

1 مصادر

آخر تحديث:

Oossallms.txt.md

مشاركة

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.

LlamAmpere v0.4 يسجّل أكثر من 95 رمزًا في الثانية على RTX 3090 – Oossa