پروژه ggml‑org/llama.cpp در ۳۰ سپتامبر ۲۰۲۶ یک نسخه پیشانتشار با برچسب b11272 منتشر کرد. این نسخه بهینهسازی ویژهای برای Hexagon به عملیات الحاق (concat) اضافه میکند؛ عملیاتی که در استنتاج مدلهای زبانی رایج است. این تغییر با کاهش سربار بستهها و استفاده از روال سریعتر تقسیم، حلقه داغِ جابهجایی دادهها را سرعت میبخشد. این بهروزرسانی بخشی از مجموعه گستردهتری از نسخهها برای پلتفرمهای مختلف است که دستگاههای Android مجهز به Snapdragon و NPUهای Hexagon را هم دربرمیگیرد.
چرا مهم است
این بهینهسازی اجرای مدلهای زبانی بزرگ را روی گوشیهای Snapdragon بهطور محسوسی سریعتر میکند و تأخیر کارهای هوش مصنوعی روی دستگاه را کاهش میدهد.