Das ggml-org-Team hat llama.cpp in Version b11494 veröffentlicht. Das Update ändert das CUDA-Backend: Es weist jedem Warp nun vier statt zwei GDN-State-Spalten zu. Diese Einstellung ist jetzt der Standard. Binaries für macOS (Apple Silicon und Intel), iOS und verschiedene Ubuntu-Versionen stehen zum Download bereit.
Warum es wichtig ist
Entwickler, die llama.cpp auf NVIDIA-GPUs nutzen, können mit schnellerer Inferenz rechnen, ohne ihren Code ändern zu müssen.