Het ggml-org-team heeft versie b11324 van llama.cpp uitgebracht. De update voegt een geheugenkaartmodus toe, die voorkomt dat bij het laden van modellen een tweede, even grote kopie van elke tensor wordt gemaakt. De wijziging is beschikbaar in nieuwe binaire pakketten voor macOS (Apple Silicon en Intel), iOS en verschillende Ubuntu-builds. In de release worden ook bijdragen van Claude en NVIDIA-engineer Pranesh Gonegandla vermeld.
Waarom het ertoe doet
Ontwikkelaars kunnen zo grotere taalmodellen draaien op dezelfde hardware. Dat is handig voor hobbyisten en kleine teams met weinig geheugen.