Le projet llama.cpp a publié la version b11490 le 2026‑10‑08. Elle prend en charge l’API « alloc_buffer_n » de Hexagon, qui permet de répartir les grands tenseurs entre plusieurs buffers. La taille du buffer dynamique par défaut passe de 128 MB à 512 MB afin d’éviter les baisses de performances avec les grands modèles. Un nouveau paramètre « --no-embd-offload » simplifie les lignes de commande pour les appareils qui ne peuvent pas décharger les embeddings. Jhen‑Jie Hong a contribué à ces changements.
Pourquoi c'est important
Les développeurs qui utilisent du matériel basé sur Hexagon peuvent exécuter de plus grands modèles de langage plus efficacement, sans avoir à régler manuellement les buffers.