Oossa

В llama.cpp b11494 ускорили CUDA-вычисления

В библиотеке Llama.cpp с открытым исходным кодом теперь используются четыре столбца состояния GDN на CUDA warp, что повышает производительность GPU.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда ggml-org выпустила llama.cpp версии b11494. В обновлении CUDA-бэкенд теперь назначает каждому warp четыре столбца состояния GDN вместо двух. Эта настройка стала значением по умолчанию. Скачать можно сборки для macOS (Apple Silicon и Intel), iOS и нескольких версий Ubuntu.

Почему это важно

Разработчики, использующие llama.cpp на GPU NVIDIA, могут рассчитывать на более быстрый инференс без изменений в коде.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.