Il team ggml‑org ha pubblicato llama.cpp versione b11262 il 29 settembre 2026. L’aggiornamento aggiunge il supporto AVX512‑FP16, che consente di calcolare prodotti scalari a precisione dimezzata (f16) accumulando i risultati a precisione singola (f32), per una maggiore accuratezza. Si tratta di una modifica di basso livello che velocizza l’inferenza sulle CPU dotate del set di istruzioni AVX512‑FP16. La release include anche nuovi binari per macOS, iOS e diverse distribuzioni Linux.
Perché conta
Permette agli sviluppatori di eseguire gli LLM più velocemente sulle CPU moderne senza compromettere la qualità numerica.