# llama.cpp ergänzt neue API für Pufferzuweisung in b11351

> Das Update vom 2. Okt. 2026 führt alloc_buffer_n in die Puffer-Schnittstelle von ggml ein und verbessert die Speicherverwaltung auf mehreren Geräten.

Oossa · 2026-10-02 · https://oossa.com/de/llama-cpp-adds-new-buffer-allocation-api-in-b11351-release

Das Projekt ggml-org/llama.cpp hat am 2026-10-02 Version b11351 veröffentlicht. Das Update ergänzt die Schnittstelle ggml_backend_buffer_type_i um die Methode alloc_buffer_n und stellt dafür die öffentliche API ggml_backend_buft_alloc_buffer_n bereit. Die Standardimplementierung unterstützt nun die Aufteilung von Puffern auf mehrere Geräte und eine verbesserte Tensorzuweisung. Für bestehende Puffertypen wie CPU, Metal und OpenVINO sowie weitere wird für die neue Methode ein NULL-Platzhalter hinterlegt. Außerdem wurden Tests für die neue Funktion hinzugefügt.

## Die Fakten

- Version b11351 wurde am 2026-10-02 veröffentlicht
- Die neue Methode alloc_buffer_n wurde in die ggml-Pufferschnittstelle aufgenommen

## Warum es wichtig ist

Entwickler können den Speicher nun auf unterschiedlicher Hardware zuverlässiger verwalten und so Zuweisungsfehler in KI-Modellen verringern.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11351](https://github.com/ggml-org/llama.cpp/releases/tag/b11351) – llama.cpp, 2026-10-02

Zuletzt aktualisiert: 2026-10-02
