# Helion يسرّع الاستدلال في vLLM عبر الواجهة الخلفية الخطية

> أضاف vLLM واجهة خلفية خطية تعتمد على Helion، تضبط نوى ضرب المصفوفات تلقائيًا، ما يرفع معدل الإنتاجية حتى 10% على وحدات Hopper GPU.

Oossa · 2026-10-02 · https://oossa.com/ar/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

دمج إطار الاستدلال vLLM ‏Helion، وهي لغة خاصة بوصف النوى ومبنية على PyTorch، في واجهته الخلفية الخطية. تتيح Helion لنواة GEMM واحدة تغطية عدة خوارزميات، وتختار تلقائيًا أسرع إعداد لكل شكل. وعلى وحدات NVIDIA Hopper GPU، تتفوق الواجهة الخلفية الجديدة على نوى CUTLASS وDeepGEMM الافتراضية في vLLM، محققةً مكاسب ثابتة في السرعة من البداية إلى النهاية، وزيادة تتجاوز 10% في معدل الإنتاجية لبعض النماذج.

## الحقائق

- تتفوق واجهة Helion الخلفية على CUTLASS وDeepGEMM على وحدات Hopper GPU، مع تحسن في معدل الإنتاجية يتجاوز 10% لبعض أعباء العمل.
- يوجه التوزيع الهجين الطلبات إلى Helion عندما لا يتجاوز عدد الرموز 32، ويعود إلى النوى الافتراضية للأشكال الأكبر. 

## لماذا يهم

يمكن للمطورين الذين يشغّلون نماذج لغوية كبيرة على وحدات Hopper GPU تسريع الاستدلال من دون كتابة نوى مخصصة.

## المصادر والمراجع

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

آخر تحديث: 2026-10-02
