Oossa

llama.cpp får flash-attention-kärnor för Metal på macOS

Den öppna LLM-miljön släppte nya binärfiler med stöd för 128/96 flash-attention för Apple Silicon den 9 okt 2026.

NotisAv Publicerad av Oossa: 1 min läsning

Teamet ggml-org uppdaterade llama.cpp (version b11518) den 9 okt 2026. Uppdateringen lägger till 128-bitars och 96-bitars flash-attention-kärnor för Metal, vilket snabbar upp inferens på Mac-datorer med Apple Silicon. Förkompilerade binärfiler för macOS (arm64), macOS Intel, iOS och flera Linux-konfigurationer finns att ladda ner.

Varför det spelar roll

Användare med Apple Silicon kan köra LLM:er snabbare utan att köpa extra GPU-hårdvara.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.