Oossa

Helion يسرّع الاستدلال في vLLM عبر الواجهة الخلفية الخطية

أضاف vLLM واجهة خلفية خطية تعتمد على Helion، تضبط نوى ضرب المصفوفات تلقائيًا، ما يرفع معدل الإنتاجية حتى 10% على وحدات Hopper GPU.

خبر موجزOossaنشرته Oossa: 1 دقائق قراءة

دمج إطار الاستدلال vLLM ‏Helion، وهي لغة خاصة بوصف النوى ومبنية على PyTorch، في واجهته الخلفية الخطية. تتيح Helion لنواة GEMM واحدة تغطية عدة خوارزميات، وتختار تلقائيًا أسرع إعداد لكل شكل. وعلى وحدات NVIDIA Hopper GPU، تتفوق الواجهة الخلفية الجديدة على نوى CUTLASS وDeepGEMM الافتراضية في vLLM، محققةً مكاسب ثابتة في السرعة من البداية إلى النهاية، وزيادة تتجاوز 10% في معدل الإنتاجية لبعض النماذج.

لماذا يهم

يمكن للمطورين الذين يشغّلون نماذج لغوية كبيرة على وحدات Hopper GPU تسريع الاستدلال من دون كتابة نوى مخصصة.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.