دمج إطار الاستدلال vLLM Helion، وهي لغة خاصة بوصف النوى ومبنية على PyTorch، في واجهته الخلفية الخطية. تتيح Helion لنواة GEMM واحدة تغطية عدة خوارزميات، وتختار تلقائيًا أسرع إعداد لكل شكل. وعلى وحدات NVIDIA Hopper GPU، تتفوق الواجهة الخلفية الجديدة على نوى CUTLASS وDeepGEMM الافتراضية في vLLM، محققةً مكاسب ثابتة في السرعة من البداية إلى النهاية، وزيادة تتجاوز 10% في معدل الإنتاجية لبعض النماذج.
لماذا يهم
يمكن للمطورين الذين يشغّلون نماذج لغوية كبيرة على وحدات Hopper GPU تسريع الاستدلال من دون كتابة نوى مخصصة.