Oossa

llama.cpp passa a executar a operação DUP na WebGPU

Uma correção na versão b11523 do llama.cpp permite que a WebGPU execute a operação DUP e evita falhas ao rodar modelos com lotes mistos.

NotaPor Publicado pelo Oossa: 1 min de leitura

A biblioteca de código aberto llama.cpp lançou a versão b11523 em 9 de outubro de 2026. A atualização corrige uma falha que ocorria quando a biblioteca tentava executar a operação DUP na WebGPU. Antes, a operação DUP era executada na CPU, enquanto as demais tarefas rodavam na WebGPU, o que causava uma incompatibilidade entre buffers e levava a uma falha. Agora, DUP segue o mesmo caminho de código das operações CPY (cópia) e CONT e permanece na WebGPU.

Por que importa

Quem usa WebGPU pode executar modelos do llama.cpp com lotes mistos sem que o programa falhe.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.