Das Team von ggml-org hat am 30. September 2026 eine neue Version von llama.cpp veröffentlicht. Sie behebt ein Problem, durch das der MUSA-GPU-Treiber CUDA_ARCH nicht definierte und einige Kernel deshalb leer kompiliert wurden. Der Patch ergänzt eine korrekte Architekturerkennung und entfernt überflüssige Prüfungen. Die Veröffentlichung umfasst außerdem zahlreiche vorgefertigte Binärdateien, nun auch für CUDA 12.8 und 13.4 unter Linux und Windows sowie für verschiedene ARM- und Apple-Silicon-Ziele.
Warum es wichtig ist
Entwickler können Llama.cpp nun ohne manuelle Patches auf MUSA-GPUs und mit neueren CUDA-Versionen ausführen.