Команда ggml-org выпустила llama.cpp версии b11510 8 октября 2026 года. В библиотеку добавили циклическое PAD-ядро для CUDA, которое позволяет обрабатывать тензоры с более чем 65 000 строк или срезов. В релиз также вошли готовые сборки для Apple Silicon, компьютеров Mac с процессорами Intel, iOS и нескольких версий Ubuntu — с поддержкой CPU, Vulkan и CUDA 12.8. Исходный код и аттестации доступны на странице GitHub.
Почему это важно
Разработчики смогут запускать на GPU NVIDIA более крупные языковые модели, не упираясь в прежнее ограничение по числу строк.