L’équipe ggml‑org a publié llama.cpp b11496 le 8 octobre 2026. Cette mise à jour ajoute une étape SYCL qui fait transiter les chargements massifs de modèles par un tampon circulaire épinglé, accélérant ainsi le chargement sur les GPU compatibles. Des binaires pour macOS (Apple Silicon et Intel), iOS et plusieurs versions d’Ubuntu (CPU, Vulkan, CUDA 12) sont disponibles au téléchargement.
Pourquoi c'est important
Les développeurs peuvent charger plus rapidement de grands modèles de langage sur du matériel compatible avec SYCL, ce qui réduit le temps de démarrage des applications utilisant llama.cpp.