Oossa

llama.cpp v0.1.11534 оптимизирует копирование данных в CUDA

Библиотека с открытым исходным кодом для запуска моделей LLaMA устраняет лишние перемещения данных в памяти GPU, снижая накладные расходы в некоторых сценариях.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда ggml-org выпустила llama.cpp версии b11534 2026-10-09. В обновлении копирование снимков состояния объединено с копированием в рекуррентный кэш, а при K = 1 — в режиме декодирования без спекулятивной обработки — удалены лишние копирования в CUDA. Изменения затрагивают только бэкенд CUDA, поэтому сборки для CPU и Vulkan не изменились. Для скачивания доступны готовые сборки для macOS, iOS и нескольких вариантов Ubuntu.

В версии с CUDA пользователи должны заметить небольшое сокращение объёма передаваемых данных в памяти GPU, что может повысить скорость на поддерживаемом оборудовании.

Почему это важно

Пользователи CUDA могут получить более высокую скорость инференса, поскольку библиотека теперь перемещает меньше данных на GPU.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.