Het team van ggml-org heeft versie b11494 van llama.cpp uitgebracht. De update past de CUDA-backend aan: die wijst voortaan vier GDN-statekolommen toe aan elke warp, in plaats van twee. Dit is nu de standaardinstelling. Er zijn binaries beschikbaar om te downloaden voor macOS (Apple Silicon en Intel), iOS en diverse Ubuntu-builds.
Waarom het ertoe doet
Ontwikkelaars die llama.cpp op NVIDIA-GPU's gebruiken, kunnen rekenen op snellere inferentie zonder hun code aan te passen.