Oossa

llama.cpp b11494 optimaliseert CUDA-warps

De opensourcelibrary llama.cpp gebruikt nu vier GDN-statekolommen per CUDA-warp, wat de GPU-prestaties verbetert.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het team van ggml-org heeft versie b11494 van llama.cpp uitgebracht. De update past de CUDA-backend aan: die wijst voortaan vier GDN-statekolommen toe aan elke warp, in plaats van twee. Dit is nu de standaardinstelling. Er zijn binaries beschikbaar om te downloaden voor macOS (Apple Silicon en Intel), iOS en diverse Ubuntu-builds.

Waarom het ertoe doet

Ontwikkelaars die llama.cpp op NVIDIA-GPU's gebruiken, kunnen rekenen op snellere inferentie zonder hun code aan te passen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.