Фреймворк для инференса vLLM интегрировал Helion — встроенный в PyTorch DSL для ядер — в свой линейный бэкенд. Helion позволяет использовать одно ядро GEMM для нескольких вариантов алгоритма и автоматически выбирает самую быструю конфигурацию для каждого размера матриц. На GPU NVIDIA Hopper новый бэкенд превосходит стандартные ядра CUTLASS и DeepGEMM в vLLM: он стабильно ускоряет работу от начала до конца, а на некоторых моделях повышает пропускную способность более чем на 10%.
Почему это важно
Разработчики, запускающие большие языковые модели на GPU Hopper, могут ускорить инференс без написания собственных ядер.