Oossa

llama.cpp добавил CUDA-ядра для блоков шириной свыше 512

В релизе от 8 октября 2026 года появились новые быстрые ядра FWHT для NVIDIA GPU, поддерживающие ширину от 1 024 до 8 192.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Проект llama.cpp выпустил версию b11482 8 октября 2026 года. В ней появились CUDA-ядра FWHT, работающие с блоками шириной более 512: теперь поддерживаются значения от 1 024 до 8 192 для данных FP32 и FP16. Изменение использует существующую инфраструктуру F16 и успешно прошло тесты на GPU A10. Прежние ядра для ширины в пределах warp (64–512) остались без изменений.

Почему это важно

Теперь пользователи GPU могут быстрее выполнять умножение матриц с большей шириной блоков в llama.cpp.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.