Il team ggml-org ha pubblicato la versione b11324 di llama.cpp. L’aggiornamento aggiunge una modalità di mappatura in memoria che evita di creare una seconda copia completa di ogni tensore durante il caricamento dei modelli. La novità è disponibile nei nuovi pacchetti binari per macOS (Apple Silicon e Intel), iOS e diverse build di Ubuntu. La versione segnala inoltre i contributi di Claude e dell’ingegnere di NVIDIA Pranesh Gonegandla.
Perché conta
Gli sviluppatori possono eseguire modelli linguistici più grandi sullo stesso hardware, un vantaggio per gli appassionati e i piccoli team con memoria limitata.