Das llama.cpp-Projekt hat am 30. September 2026 eine neue Version veröffentlicht. Sie unterstützt GLM‑5.3‑Flash (auch GLM5‑Next genannt), eine neuere Sprachmodellarchitektur. Das Update verkleinert außerdem den Rechenpuffer, beschleunigt das Decoding bei langen Kontexten und behebt mehrere Fehler bei der Token-Verarbeitung und dem GPU-Speicher. Die Änderungen richten sich an Entwickler, die LLMs lokal auf CPUs oder GPUs ausführen.
Warum es wichtig ist
Mit den neuen Funktionen können Nutzer die aktuellen GLM-Modelle auf eigener Hardware schneller und mit weniger Speicher ausführen.