L’équipe ggml-org a publié la version b11531 de llama.cpp. Elle remanie l’API de chat et inclut des binaires précompilés pour macOS (Apple Silicon et Intel), iOS et plusieurs variantes d’Ubuntu, notamment avec prise en charge du CPU, de Vulkan et de CUDA 12.8. Les liens de téléchargement sont disponibles sur la page de la version sur GitHub. Les utilisateurs peuvent désormais exécuter des LLM en local sur davantage de plateformes sans avoir à compiler le logiciel eux-mêmes.
Pourquoi c'est important
Les développeurs peuvent exécuter des modèles Llama en local sur davantage d’appareils dès aujourd’hui, sans étape de compilation et avec prise en charge de l’accélération GPU sous Ubuntu.