Oossa

llama.cpp b11510 снимает ограничение CUDA по числу строк

В версии b11510 библиотеки llama.cpp появился новый CUDA-ядро для обработки тензоров с числом строк более 65 535. В релиз также вошли готовые сборки для macOS, iOS и Linux.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда ggml-org выпустила llama.cpp версии b11510 8 октября 2026 года. В библиотеку добавили циклическое PAD-ядро для CUDA, которое позволяет обрабатывать тензоры с более чем 65 000 строк или срезов. В релиз также вошли готовые сборки для Apple Silicon, компьютеров Mac с процессорами Intel, iOS и нескольких версий Ubuntu — с поддержкой CPU, Vulkan и CUDA 12.8. Исходный код и аттестации доступны на странице GitHub.

Почему это важно

Разработчики смогут запускать на GPU NVIDIA более крупные языковые модели, не упираясь в прежнее ограничение по числу строк.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.