پروژه llama.cpp نسخه b11490 را در 2026‑10‑08 منتشر کرد. این نسخه از API «alloc_buffer_n» در Hexagon پشتیبانی میکند و به این ترتیب تنسورهای بزرگ را میتوان میان چند بافر تقسیم کرد. اندازه پیشفرض بافر پویا از 128 MB به 512 MB افزایش یافته تا از افت عملکرد هنگام کار با مدلهای بزرگ جلوگیری شود. پرچم جدید «--no-embd-offload» هم نوشتن خط فرمان را برای دستگاههایی که نمیتوانند تعبیهها را برونسپاری کنند سادهتر میکند. Jhen‑Jie Hong نیز در نگارش این تغییرات همکاری داشته است.
چرا مهم است
توسعهدهندگانی که از سختافزار مبتنی بر Hexagon استفاده میکنند، میتوانند مدلهای زبانی بزرگتری را با بازده بیشتر و بدون نیاز به تنظیم دستی بافر اجرا کنند.