Oossa

llama.cpp kan nu tensors rechtstreeks in het geheugen laden

De open-sourceruntime voor LLM’s kan modeldata nu rechtstreeks in het geheugen koppelen. Dat bespaart RAM op builds voor macOS, iOS en Linux.

Kort berichtOossaGepubliceerd door Oossa: 1 min lezen

Het ggml-org-team heeft versie b11324 van llama.cpp uitgebracht. De update voegt een geheugenkaartmodus toe, die voorkomt dat bij het laden van modellen een tweede, even grote kopie van elke tensor wordt gemaakt. De wijziging is beschikbaar in nieuwe binaire pakketten voor macOS (Apple Silicon en Intel), iOS en verschillende Ubuntu-builds. In de release worden ook bijdragen van Claude en NVIDIA-engineer Pranesh Gonegandla vermeld.

Waarom het ertoe doet

Ontwikkelaars kunnen zo grotere taalmodellen draaien op dezelfde hardware. Dat is handig voor hobbyisten en kleine teams met weinig geheugen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.