Il team ggml-org ha pubblicato la release b11531 di llama.cpp. La versione rinnova l’API per le chat e include binari precompilati per macOS (Apple Silicon e Intel), iOS e diverse varianti di Ubuntu, con supporto a CPU, Vulkan e CUDA 12.8. I link per il download sono disponibili nella pagina della release su GitHub. Ora gli utenti possono eseguire localmente gli LLM su più piattaforme senza dover compilare il software.
Perché conta
Gli sviluppatori possono eseguire da subito i modelli Llama in locale su più dispositivi, evitando la compilazione e sfruttando l’accelerazione GPU su Ubuntu.