تیم ggml‑org در 8 اکتبر 2026 نسخه b11510 از llama.cpp را منتشر کرد. این نسخه یک هسته PAD حلقهای برای CUDA اضافه میکند تا کتابخانه بتواند تنسورهایی با بیش از 65,000 ردیف یا برش را پردازش کند. همچنین فایلهای اجرایی ازپیشساختهشدهای برای Apple Silicon، macOS اینتل، iOS و چند نسخه Ubuntu (CPU، Vulkan و CUDA 12.8) در آن گنجانده شده است. کد و گواهیهای تأیید از صفحه GitHub در دسترساند.
چرا مهم است
توسعهدهندگان اکنون میتوانند مدلهای زبانی بزرگتری را روی GPUهای NVIDIA اجرا کنند، بیآنکه به محدودیت قبلی تعداد ردیفها برخورد کنند.