L’équipe ggml‑org a publié la version b11487 de llama.cpp. Elle ajoute la prise en charge de GET_ROWS pour les formats Q4_K et Q6_K tuilés sur les processeurs Hexagon et améliore la gestion des vues Q4_K. Des binaires précompilés sont proposés pour Apple Silicon, les Mac Intel, iOS et plusieurs versions d’Ubuntu (CPU et Vulkan). La mise à jour est disponible sur la page des versions de GitHub.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter des modèles Llama plus efficaces sur des appareils équipés de puces Hexagon, comme celles de Qualcomm, et améliorer ainsi les performances sur le matériel mobile et embarqué compatible.