ggml-org ekibi llama.cpp’nin b11494 sürümünü yayımladı. Güncelleme, CUDA arka ucunda warp başına atanan GDN durum sütunu sayısını ikiden dörde çıkarıyor. Bu ayar artık varsayılan. macOS (Apple Silicon ve Intel), iOS ve çeşitli Ubuntu sürümleri için ikili dosyalar indirilebilir.
Neden önemli
llama.cpp’yi NVIDIA GPU’larda kullanan geliştiriciler, kodlarında değişiklik yapmadan daha hızlı çıkarım elde edebilir.