Oossa

Helion ускоряет линейные операции в vLLM

В vLLM появился линейный бэкенд на базе Helion: он автоматически подбирает ядра умножения матриц и повышает пропускную способность на Hopper GPU до 10%.

ЗаметкаOossaОпубликовано Oossa: 1 мин чтения

Фреймворк для инференса vLLM интегрировал Helion — встроенный в PyTorch DSL для ядер — в свой линейный бэкенд. Helion позволяет использовать одно ядро GEMM для нескольких вариантов алгоритма и автоматически выбирает самую быструю конфигурацию для каждого размера матриц. На GPU NVIDIA Hopper новый бэкенд превосходит стандартные ядра CUTLASS и DeepGEMM в vLLM: он стабильно ускоряет работу от начала до конца, а на некоторых моделях повышает пропускную способность более чем на 10%.

Почему это важно

Разработчики, запускающие большие языковые модели на GPU Hopper, могут ускорить инференс без написания собственных ядер.

Источники и ссылки

1 источников
  1. PyTorchЧитать первоисточник

Обновлено: ·Markdown

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.