Il team ggml‑org ha pubblicato la versione b11268 di llama.cpp. L’aggiornamento corregge un bug nel driver OpenCL che gestiva i tensori per il kernel q5_K delle GPU Adreno. Sono disponibili nuovi binari precompilati per macOS con Apple Silicon, Mac Intel, iOS e diverse configurazioni Linux, incluse CPU, Vulkan e CUDA 12.8.
Perché conta
La correzione migliora prestazioni e stabilità per gli sviluppatori che eseguono LLM su dispositivi Android con GPU Adreno.