La libreria open source llama.cpp ha rilasciato la versione b11523 il 9 ottobre 2026. L’aggiornamento corregge un arresto anomalo che si verificava quando la libreria tentava di eseguire l’operazione DUP su WebGPU. In precedenza, DUP veniva eseguita sulla CPU mentre le altre operazioni erano gestite da WebGPU, causando un’incompatibilità tra i buffer e il conseguente arresto anomalo. Ora DUP segue lo stesso percorso di codice delle operazioni CPY (copy) e CONT, quindi viene eseguita su WebGPU.
Perché conta
Chi usa WebGPU può eseguire modelli llama.cpp con batch misti senza che il programma si arresti.