Oossa

llama.cpp accelera la dequantizzazione dei pesi Q6_K

La versione b11489 velocizza la dequantizzazione dei pesi Q6_K e raddoppia il fattore di unrolling. Sono disponibili nuovi binari per macOS, iOS e Linux.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il team di ggml‑org ha rilasciato la versione b11489 di llama.cpp. L’aggiornamento velocizza la dequantizzazione dei pesi Q6_K — il processo che riconverte i pesi compressi del modello in numeri utilizzabili — e raddoppia il fattore di unrolling, secondo le note di rilascio. Sono ora disponibili binari precompilati per Apple Silicon, macOS con processori Intel, iOS e diverse configurazioni di Ubuntu, comprese le build Vulkan e CUDA.

Perché conta

La dequantizzazione più rapida consente agli sviluppatori di eseguire LLM sullo stesso hardware con una latenza inferiore.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.