El equipo de ggml-org publicó la versión b11487 de llama.cpp. Esta añade compatibilidad con GET_ROWS para Q4_K y Q6_K en mosaico en procesadores Hexagon y mejora el manejo de las vistas Q4_K. Se ofrecen binarios precompilados para Apple Silicon, macOS con Intel, iOS y varias versiones de Ubuntu (CPU y Vulkan). La actualización se puede descargar desde la página de lanzamientos de GitHub.
Por qué importa
Los desarrolladores ahora pueden ejecutar modelos Llama de forma más eficiente en dispositivos con Hexagon, como los que usan chips Qualcomm, y mejorar el rendimiento en el hardware móvil e integrado compatible.