Das Team von ggml-org hat llama.cpp in Version b11531 veröffentlicht. Die Chat-API wurde überarbeitet; außerdem enthält das Release vorgefertigte Binärdateien für macOS (Apple Silicon und Intel), iOS und mehrere Ubuntu-Varianten, darunter Versionen für CPU, Vulkan und CUDA 12.8. Die Download-Links finden sich auf der GitHub-Release-Seite. Damit können Nutzer LLMs auf mehr Plattformen lokal ausführen, ohne sie selbst kompilieren zu müssen.
Warum es wichtig ist
Entwickler können Llama-Modelle ab sofort lokal auf mehr Geräten ausführen. Das erspart den Build-Schritt und ermöglicht GPU-Beschleunigung unter Ubuntu.