# В llama.cpp b11494 ускорили CUDA-вычисления

> В библиотеке Llama.cpp с открытым исходным кодом теперь используются четыре столбца состояния GDN на CUDA warp, что повышает производительность GPU.

Oossa · 2026-10-08 · https://oossa.com/ru/llama-cpp-release-b11494-adds-cuda-warp-optimizations

Команда ggml-org выпустила llama.cpp версии b11494. В обновлении CUDA-бэкенд теперь назначает каждому warp четыре столбца состояния GDN вместо двух. Эта настройка стала значением по умолчанию. Скачать можно сборки для macOS (Apple Silicon и Intel), iOS и нескольких версий Ubuntu.

## Факты

- Релиз с тегом b11494 опубликован 2026-10-08
- Значение cols_per_warp по умолчанию для CUDA установлено на 4

## Почему это важно

Разработчики, использующие llama.cpp на GPU NVIDIA, могут рассчитывать на более быстрый инференс без изменений в коде.

## Источники и ссылки

1. [ggml-org/llama.cpp b11494](https://github.com/ggml-org/llama.cpp/releases/tag/b11494) – llama.cpp, 2026-10-08

Обновлено: 2026-10-08
