Il team ggml-org ha rilasciato la versione b11398 di llama.cpp, che aggiunge al backend CPU tinyBLAS il supporto all’elaborazione delle code BF16, FP16 e FP32 sulle piattaforme x86. Le modifiche vettorializzano anche queste code per velocizzare i calcoli. Sono disponibili binari precompilati per macOS (Apple Silicon e Intel), iOS e diverse architetture Ubuntu. L’aggiornamento include modifiche ai test per garantire confronti accurati con le implementazioni di riferimento.
Perché conta
Gli sviluppatori possono ora eseguire l’inferenza degli LLM più velocemente sulle normali CPU, senza ricorrere all’accelerazione GPU.