Das ggml‑org-Team hat llama.cpp Version b11270 am 30. September 2026 veröffentlicht. Dabei wurde eine GPU-Operation für AMDs HIP-Plattform angepasst: Eine langsamere Byte-Subtraktionsanweisung wurde durch eine schnellere ersetzt. Die Veröffentlichung umfasst außerdem neue Binärpakete für macOS (Apple Silicon und Intel), iOS sowie mehrere Ubuntu-Versionen, darunter Varianten mit Vulkan-Unterstützung für GPUs.
Warum es wichtig ist
Die GPU-Optimierung kann die Inferenz auf AMD-Hardware beschleunigen. Die sofort einsatzbereiten Binärdateien erleichtern es Entwicklern zudem, llama.cpp auf weiteren Plattformen auszuprobieren.