El proyecto llama.cpp publicó la versión b11490 el 2026‑10‑08. Añade compatibilidad con la API «alloc_buffer_n» de Hexagon, que permite dividir tensores grandes entre varios buffers. El tamaño predeterminado del buffer dinámico aumenta de 128 MB a 512 MB para evitar caídas de rendimiento con modelos grandes. Una nueva opción «--no-embd-offload» simplifica los comandos en dispositivos que no pueden descargar las capas de embeddings. Jhen‑Jie Hong colaboró en estos cambios.
Por qué importa
Los desarrolladores que usan hardware basado en Hexagon pueden ejecutar modelos de lenguaje más grandes y con mayor eficiencia, sin tener que ajustar los buffers manualmente.