Il team di ggml‑org ha rilasciato la versione b11489 di llama.cpp. L’aggiornamento velocizza la dequantizzazione dei pesi Q6_K — il processo che riconverte i pesi compressi del modello in numeri utilizzabili — e raddoppia il fattore di unrolling, secondo le note di rilascio. Sono ora disponibili binari precompilati per Apple Silicon, macOS con processori Intel, iOS e diverse configurazioni di Ubuntu, comprese le build Vulkan e CUDA.
Perché conta
La dequantizzazione più rapida consente agli sviluppatori di eseguire LLM sullo stesso hardware con una latenza inferiore.