أصدر فريق ggml‑org الإصدار b11494 من llama.cpp. ويغيّر التحديث آلية عمل واجهة CUDA الخلفية، بحيث تخصص أربعة أعمدة لحالة GDN لكل warp بدلًا من عمودين. وأصبح هذا الإعداد هو الافتراضي الآن. تتوفر للتنزيل ملفات ثنائية لأنظمة macOS (Apple Silicon وIntel) وiOS، وعدة إصدارات من Ubuntu.
لماذا يهم
يمكن للمطورين الذين يستخدمون llama.cpp على وحدات GPU من NVIDIA توقع استدلال أسرع من دون الحاجة إلى تغيير شيفراتهم.