Das llama.cpp-Projekt hat am 9. Okt. 2026 eine neue Vorabversion mit dem Namen b11517 veröffentlicht. Das Update ergänzt eine CUDA-Option, mit der Nutzer die Präzision von source-1 an die MMQ-Hilfsfunktionen übergeben können – einen niedrigstufigen Teil des GPU-Codes. Die Änderung stammt von einem NVIDIA-Mitwirkenden und gilt für die aufgeführten CUDA-12- und CUDA-13-Builds für Linux und Windows. Die Veröffentlichung umfasst außerdem Build-Ziele für viele weitere Plattformen, von Apple-Silicon-Macs bis hin zu Android-Geräten mit Snapdragon.
Das Update ist auf der GitHub-Seite des Projekts und auf der Website llama.app verfügbar.
Warum es wichtig ist
Entwickler können nun die GPU-Präzision in llama.cpp steuern. Das könnte die Leistung oder den Speicherbedarf beim Ausführen von LLaMA-Modellen verbessern.