Il team ggml-org ha rilasciato la versione b11494 di llama.cpp. L’aggiornamento modifica il backend CUDA, assegnando a ogni warp quattro colonne di stato GDN anziché due. Questa impostazione è ora predefinita. Sono disponibili per il download i binari per macOS (Apple Silicon e Intel), iOS e diverse versioni di Ubuntu.
Perché conta
Chi usa llama.cpp con GPU NVIDIA può aspettarsi un’inferenza più veloce senza dover modificare il proprio codice.