Oossa

llama.cpp: tinyBLAS supporta BF16 e FP16 sulle CPU x86

La libreria open source llama.cpp ora vettorializza le code BF16, FP16 e FP32 nel backend tinyBLAS, accelerando l’inferenza su CPU.

BreveOossaPubblicato da Oossa: 1 min di lettura

Il team ggml-org ha rilasciato la versione b11398 di llama.cpp, che aggiunge al backend CPU tinyBLAS il supporto all’elaborazione delle code BF16, FP16 e FP32 sulle piattaforme x86. Le modifiche vettorializzano anche queste code per velocizzare i calcoli. Sono disponibili binari precompilati per macOS (Apple Silicon e Intel), iOS e diverse architetture Ubuntu. L’aggiornamento include modifiche ai test per garantire confronti accurati con le implementazioni di riferimento.

Perché conta

Gli sviluppatori possono ora eseguire l’inferenza degli LLM più velocemente sulle normali CPU, senza ricorrere all’accelerazione GPU.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.