La libreria open source llama.cpp ha rilasciato la versione b11505 il 2026‑10‑08. L’aggiornamento corregge un bug nello shader Vulkan dell’operazione top‑k. In precedenza, i valori +inf e NaN venivano ignorati e potevano causare blocchi sulle GPU NVIDIA o indici errati sulle GPU AMD. La patch converte NaN in -inf, amplia l’intervallo dei bucket per conteggiare tutti i valori e corregge il percorso k = 1 per i numeri negativi. Un nuovo test, chiamato test_top_k_inf, verifica questi casi.
Perché conta
Gli sviluppatori che usano llama.cpp con Vulkan avranno meno arresti anomali e risultati più accurati nell’ordinamento dei token quando i prompt contengono valori float estremi.