A biblioteca de código aberto llama.cpp lançou a versão b11523 em 9 de outubro de 2026. A atualização corrige uma falha que ocorria quando a biblioteca tentava executar a operação DUP na WebGPU. Antes, a operação DUP era executada na CPU, enquanto as demais tarefas rodavam na WebGPU, o que causava uma incompatibilidade entre buffers e levava a uma falha. Agora, DUP segue o mesmo caminho de código das operações CPY (cópia) e CONT e permanece na WebGPU.
Por que importa
Quem usa WebGPU pode executar modelos do llama.cpp com lotes mistos sem que o programa falhe.