A biblioteca de código aberto llama.cpp lançou a versão b11505 em 2026-10-08. A atualização corrige um bug no shader Vulkan da operação top‑k. Antes, valores +inf e NaN eram ignorados e podiam causar travamentos em GPUs NVIDIA ou índices incorretos em GPUs AMD. A correção converte NaN em -inf, amplia o intervalo de buckets para contabilizar todos os valores e ajusta o caminho k = 1 para números negativos. Um novo teste, chamado test_top_k_inf, verifica esses casos.
Por que importa
Desenvolvedores que usam llama.cpp com Vulkan terão menos travamentos e resultados mais precisos na classificação de tokens quando os prompts contiverem valores extremos de ponto flutuante.