El proyecto ggml‑org/llama.cpp publicó una versión preliminar (etiqueta b11272) el 30 de septiembre de 2026. Incluye una optimización específica para Hexagon de la operación de concatenación, habitual durante la inferencia de modelos de lenguaje. El cambio reduce la sobrecarga de paquetes y emplea una rutina de división más rápida, lo que acelera el ciclo de procesamiento intensivo que mueve los datos. La actualización forma parte de un conjunto más amplio de versiones para distintas plataformas, incluidos los dispositivos Android con Snapdragon y NPU Hexagon.
Por qué importa
Permite ejecutar modelos de lenguaje de forma notablemente más rápida en teléfonos Snapdragon y reduce la latencia de las tareas de IA en el dispositivo.