Oossa

llama.cpp får stöd för MoE-cache på flera GPU:er

Det öppna biblioteket llama.cpp kan nu köra mixture-of-experts-modeller på flera GPU:er.

NotisAv Publicerad av Oossa: 1 min läsning

Teamet ggml-org släppte llama.cpp version b11507 den 8 oktober 2026. Uppdateringen lägger till stöd för en mixture-of-experts-cache (MoE-cache) som kan fördelas över flera GPU:er. Det gör att utvecklare kan köra större MoE-modeller utan att allt behöver rymmas på ett enda kort. Uppdateringen innehåller också nya binärpaket för macOS, iOS och flera Linux-konfigurationer, däribland stöd för CUDA 12.8.

Varför det spelar roll

Utvecklare kan nu köra större och mer avancerade AI-modeller på system med flera GPU:er, vilket utökar möjligheterna med egen hårdvara.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.