Teamet ggml-org har släppt llama.cpp version b11494. Uppdateringen ändrar CUDA-bakänden så att varje warp tilldelas fyra GDN-tillståndskolumner i stället för två. Det här är nu standardinställningen. Binärfiler för macOS (Apple Silicon och Intel), iOS och flera Ubuntu-versioner finns att ladda ner.
Varför det spelar roll
Utvecklare som använder llama.cpp på NVIDIA-GPU:er kan räkna med snabbare inferens utan att ändra sin kod.