Oossa

llama.cpp lägger till GPU-cache för MoE-experter

Det öppna biblioteket llama.cpp lagrar nu data för mixture-of-experts-modeller (MoE) i en GPU-cache i värdminnet.

NotisAv Publicerad av Oossa: Senast uppdaterad: 1 min läsning

Teamet ggml-org släppte llama.cpp version b11480 den 2026-10-08. Uppdateringen lägger till en GPU-cache för MoE-experter i värdminnet, vilket hjälper stora modeller att köras snabbare på GPU:er. Ändringen är markerad som assisterad av Claude och använder det nya API:et llama_moe_cache_ptr. Förkompilerade binärfiler för macOS, iOS och flera Ubuntu-konfigurationer finns att ladda ner.

Varför det spelar roll

Utvecklare kan nu köra MoE-modeller effektivare på konsument-GPU:er, vilket sänker hårdvarukostnaden för AI-projekt.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.