# llama.cpp добавил CUDA-ядра для блоков шириной свыше 512

> В релизе от 8 октября 2026 года появились новые быстрые ядра FWHT для NVIDIA GPU, поддерживающие ширину от 1 024 до 8 192.

Oossa · 2026-10-08 · https://oossa.com/ru/llama-cpp-adds-cuda-kernels-for-block-widths-over-512

Проект llama.cpp выпустил версию b11482 8 октября 2026 года. В ней появились CUDA-ядра FWHT, работающие с блоками шириной более 512: теперь поддерживаются значения от 1 024 до 8 192 для данных FP32 и FP16. Изменение использует существующую инфраструктуру F16 и успешно прошло тесты на GPU A10. Прежние ядра для ширины в пределах warp (64–512) остались без изменений.

## Факты

- Релиз b11482 опубликован 8 октября 2026 года
- Новые ядра поддерживают ширину от 1 024 до 8 192 для FP32 и FP16

## Почему это важно

Теперь пользователи GPU могут быстрее выполнять умножение матриц с большей шириной блоков в llama.cpp.

## Источники и ссылки

1. [ggml-org/llama.cpp b11482](https://github.com/ggml-org/llama.cpp/releases/tag/b11482) – llama.cpp, 2026-10-08

Обновлено: 2026-10-08
