# llama.cpp v0.1.11534 оптимизирует копирование данных в CUDA

> Библиотека с открытым исходным кодом для запуска моделей LLaMA устраняет лишние перемещения данных в памяти GPU, снижая накладные расходы в некоторых сценариях.

Oossa · 2026-10-09 · https://oossa.com/ru/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

Команда ggml-org выпустила llama.cpp версии b11534 2026-10-09. В обновлении копирование снимков состояния объединено с копированием в рекуррентный кэш, а при K = 1 — в режиме декодирования без спекулятивной обработки — удалены лишние копирования в CUDA. Изменения затрагивают только бэкенд CUDA, поэтому сборки для CPU и Vulkan не изменились. Для скачивания доступны готовые сборки для macOS, iOS и нескольких вариантов Ubuntu.

В версии с CUDA пользователи должны заметить небольшое сокращение объёма передаваемых данных в памяти GPU, что может повысить скорость на поддерживаемом оборудовании.

## Факты

- Версия b11534 выпущена 2026-10-09
- Лишние копирования в CUDA устранены при K = 1 (режим без спекулятивного декодирования)

## Почему это важно

Пользователи CUDA могут получить более высокую скорость инференса, поскольку библиотека теперь перемещает меньше данных на GPU.

## Источники и ссылки

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

Обновлено: 2026-10-09
