تیم ggml‑org نسخه b11494 از llama.cpp را منتشر کرد. در این بهروزرسانی، بکاند CUDA بهجای دو ستون، چهار ستون حالت GDN را به هر وارپ اختصاص میدهد. این تنظیم اکنون بهصورت پیشفرض فعال است. فایلهای اجرایی برای macOS (Apple Silicon و Intel)، iOS و چند نسخه از Ubuntu برای دانلود در دسترساند.
چرا مهم است
توسعهدهندگانی که llama.cpp را روی GPUهای NVIDIA اجرا میکنند، میتوانند بدون تغییر کد خود انتظار استنتاج سریعتری داشته باشند.