Oossa

llama.cpp b11494 ottimizza i warp CUDA

La libreria open source Llama.cpp assegna ora quattro colonne di stato GDN a ogni warp CUDA, migliorando le prestazioni della GPU.

BreveDi Pubblicato da Oossa: 1 min di lettura

Il team ggml-org ha rilasciato la versione b11494 di llama.cpp. L’aggiornamento modifica il backend CUDA, assegnando a ogni warp quattro colonne di stato GDN anziché due. Questa impostazione è ora predefinita. Sono disponibili per il download i binari per macOS (Apple Silicon e Intel), iOS e diverse versioni di Ubuntu.

Perché conta

Chi usa llama.cpp con GPU NVIDIA può aspettarsi un’inferenza più veloce senza dover modificare il proprio codice.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.