# افزایش سرعت استنتاج در vLLM با بک‌اند خطی Helion

> vLLM اکنون بک‌اند خطی مبتنی بر Helion را دارد که کرنل‌های ضرب ماتریسی را به‌طور خودکار بهینه می‌کند و روی پردازنده‌های گرافیکی Hopper تا 10% گذردهی بیشتری ارائه می‌دهد.

Oossa · 2026-10-02 · https://oossa.com/fa/helion-kernel-adds-to-vllm-linear-backend-for-faster-inference

چارچوب استنتاج vLLM، زبان توصیف کرنل بومی PyTorch به نام Helion را به بک‌اند خطی خود افزوده است. Helion امکان می‌دهد یک کرنل GEMM چندین گونه الگوریتمی را پوشش دهد و سریع‌ترین پیکربندی را برای هر شکل به‌طور خودکار انتخاب کند. روی پردازنده‌های گرافیکی NVIDIA Hopper، بک‌اند جدید از کرنل‌های پیش‌فرض CUTLASS و DeepGEMM در vLLM سریع‌تر است و به‌طور پیوسته سرعت اجرای سرتاسری را افزایش می‌دهد؛ همچنین در برخی مدل‌ها گذردهی را بیش از 10% بالا می‌برد.

## حقایق

- بک‌اند Helion روی پردازنده‌های گرافیکی Hopper از CUTLASS و DeepGEMM بهتر عمل می‌کند و در برخی بارهای کاری گذردهی را بیش از 10% افزایش می‌دهد.
- در سازوکار توزیع ترکیبی، برای تعداد توکن‌های حداکثر 32 از Helion استفاده می‌شود و برای شکل‌های بزرگ‌تر، اجرا به کرنل‌های پیش‌فرض برمی‌گردد.

## چرا مهم است

توسعه‌دهندگانی که مدل‌های زبانی بزرگ را روی پردازنده‌های گرافیکی Hopper اجرا می‌کنند، می‌توانند بدون نوشتن کرنل‌های سفارشی، به استنتاج سریع‌تری دست پیدا کنند.

## منابع و ارجاع‌ها

1. [Building a High-Performance and Portable vLLM Linear Backend with Helion](https://pytorch.org/blog/building-a-high-performance-and-portable-vllm-linear-backend-with-helion/) – PyTorch

آخرین به‌روزرسانی: 2026-10-02
