# llama.cpp: Update bringt GLM‑5.3‑Flash und mehr Tempo

> Die Open-Source-LLM-Laufzeitumgebung llama.cpp v0.1.0 unterstützt nun GLM‑5.3‑Flash und bietet mehrere Verbesserungen bei Geschwindigkeit und Speicherverbrauch.

Oossa · 2026-09-30 · https://oossa.com/de/llama-cpp-updates-add-glm-5-3-flash-support-and-performance-tweaks

Mit KI-Unterstützung erstellt und übersetzt. Prüfen Sie die Originalquellen unten.

Das llama.cpp-Projekt hat am 30. September 2026 eine neue Version veröffentlicht. Sie unterstützt GLM‑5.3‑Flash (auch GLM5‑Next genannt), eine neuere Sprachmodellarchitektur. Das Update verkleinert außerdem den Rechenpuffer, beschleunigt das Decoding bei langen Kontexten und behebt mehrere Fehler bei der Token-Verarbeitung und dem GPU-Speicher. Die Änderungen richten sich an Entwickler, die LLMs lokal auf CPUs oder GPUs ausführen.

## Die Fakten

- Veröffentlichungsdatum: 30.09.2026 („Mi., 30. Sep. 2026“)
- Unterstützung für das Modell GLM‑5.3‑Flash (GLM5‑Next) hinzugefügt

## Warum es wichtig ist

Mit den neuen Funktionen können Nutzer die aktuellen GLM-Modelle auf eigener Hardware schneller und mit weniger Speicher ausführen.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11279](https://github.com/ggml-org/llama.cpp/releases/tag/b11279) – llama.cpp, 2026-09-30
2. [add GLM-5.3-Flash (GLM5-Next) support by timkhronos · Pull Request #27773 · ggml-org/llama.cpp](https://www.reddit.com/r/LocalLLaMA/comments/1wu0bdf/add_glm53flash_glm5next_support_by_timkhronos/) – Reddit r/LocalLLaMA, 2026-09-30
3. [add GLM-5.3-Flash (GLM5-Next) support (#27773) · ggml-org/llama.cpp@649dcb1](https://www.reddit.com/r/LocalLLaMA/comments/1wu3wxu/add_glm53flash_glm5next_support_27773/) – Reddit r/LocalLLaMA, 2026-09-30

Zuletzt aktualisiert: 2026-09-30
