# llama.cpp passa a executar a operação DUP na WebGPU

> Uma correção na versão b11523 do llama.cpp permite que a WebGPU execute a operação DUP e evita falhas ao rodar modelos com lotes mistos.

Oossa · 2026-10-09 · https://oossa.com/pt/llama-cpp-adds-webgpu-support-for-duplicate-operation

A biblioteca de código aberto llama.cpp lançou a versão b11523 em 9 de outubro de 2026. A atualização corrige uma falha que ocorria quando a biblioteca tentava executar a operação DUP na WebGPU. Antes, a operação DUP era executada na CPU, enquanto as demais tarefas rodavam na WebGPU, o que causava uma incompatibilidade entre buffers e levava a uma falha. Agora, DUP segue o mesmo caminho de código das operações CPY (cópia) e CONT e permanece na WebGPU.

## Os fatos

- A versão b11523 foi lançada em 2026-10-09
- A correção acrescenta suporte da WebGPU à operação GGML_OP_DUP

## Por que importa

Quem usa WebGPU pode executar modelos do llama.cpp com lotes mistos sem que o programa falhe.

## Fontes e referências

1. [ggml-org/llama.cpp b11523](https://github.com/ggml-org/llama.cpp/releases/tag/b11523) – llama.cpp, 2026-10-09

Última atualização: 2026-10-09
