Oossa

llama.cpp b11494 optimerar CUDA-kärnor

Biblioteket Llama.cpp med öppen källkod använder nu fyra GDN-tillståndskolumner per CUDA-warp, vilket förbättrar GPU-prestandan.

NotisAv Publicerad av Oossa: 1 min läsning

Teamet ggml-org har släppt llama.cpp version b11494. Uppdateringen ändrar CUDA-bakänden så att varje warp tilldelas fyra GDN-tillståndskolumner i stället för två. Det här är nu standardinställningen. Binärfiler för macOS (Apple Silicon och Intel), iOS och flera Ubuntu-versioner finns att ladda ner.

Varför det spelar roll

Utvecklare som använder llama.cpp på NVIDIA-GPU:er kan räkna med snabbare inferens utan att ändra sin kod.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.