Il team ggml‑org ha pubblicato llama.cpp b11496 l’8 ottobre 2026. L’aggiornamento introduce una fase SYCL che trasferisce i caricamenti in blocco dei modelli tramite un buffer circolare bloccato in memoria, velocizzando il caricamento sulle GPU compatibili. Sono disponibili per il download i binari per macOS (Apple Silicon e Intel), iOS e diverse versioni di Ubuntu (CPU, Vulkan, CUDA 12).
Perché conta
Gli sviluppatori possono caricare più rapidamente i modelli linguistici di grandi dimensioni sull’hardware compatibile con SYCL, riducendo i tempi di avvio delle app che usano llama.cpp.