Das Projekt ggml-org/llama.cpp hat am 2026-10-02 Version b11351 veröffentlicht. Das Update ergänzt die Schnittstelle ggml_backend_buffer_type_i um die Methode alloc_buffer_n und stellt dafür die öffentliche API ggml_backend_buft_alloc_buffer_n bereit. Die Standardimplementierung unterstützt nun die Aufteilung von Puffern auf mehrere Geräte und eine verbesserte Tensorzuweisung. Für bestehende Puffertypen wie CPU, Metal und OpenVINO sowie weitere wird für die neue Methode ein NULL-Platzhalter hinterlegt. Außerdem wurden Tests für die neue Funktion hinzugefügt.
Warum es wichtig ist
Entwickler können den Speicher nun auf unterschiedlicher Hardware zuverlässiger verwalten und so Zuweisungsfehler in KI-Modellen verringern.