Проект ggml‑org/llama.cpp выпустил версию b11351 2026‑10‑02. В обновлении в интерфейс ggml_backend_buffer_type_i добавлен метод alloc_buffer_n, а в публичный API — функция ggml_backend_buft_alloc_buffer_n. Реализация по умолчанию теперь поддерживает распределение буферов между несколькими устройствами и улучшает выделение памяти для тензоров. Для существующих типов буферов, включая CPU, Metal и OpenVINO, а также других, в новом методе предусмотрена заглушка NULL. Добавлены тесты новой функциональности.
Почему это важно
Разработчики смогут надежнее управлять памятью на разных устройствах и сократить число ошибок выделения памяти при работе с моделями ИИ.