# llama.cpp corregge la gestione CPU degli input BF16

> La versione b11292 aggiunge il supporto CPU per un input di matrice BF16 usato nella convoluzione depthwise e rende più rigorosi i controlli di supporto di Vulkan.

Oossa · 2026-09-30 · https://oossa.com/it/llama-cpp-fixes-cpu-handling-for-bf16-matrix-inputs

Prodotto e tradotto con l’aiuto dell’IA. Consulta le fonti originali qui sotto.

La versione b11292 di llama.cpp corregge una limitazione del backend CPU che riguardava la convoluzione 1D depthwise quando il kernel usa BF16, un formato numerico a 16 bit. Ora il backend CPU converte quell’input in virgola mobile a 32 bit per eseguire il calcolo, uniformandosi all’aritmetica del kernel matrix-vector di Metal.

La versione modifica anche i controlli di Vulkan: BF16 viene accettato come secondo input di matrice solo se anche il primo è BF16. Le altre combinazioni sono contrassegnate come non supportate, così lo scheduler le assegna alla CPU. Le note parlano di nuovi test, ma non indicano quando le modifiche arriveranno in un’app distribuita né quali utenti le riceveranno.

## I fatti

- La versione è llama.cpp b11292, pubblicata il 30 settembre 2026.
- Le note riguardano un test di convoluzione depthwise con kernel F32, F16 e BF16, oltre a tre casi di moltiplicazione di matrici con BF16 come secondo input.

## Perché conta

Per gli sviluppatori che eseguono convoluzioni depthwise BF16, il backend CPU può ora gestire una combinazione che prima rifiutava; le note non specificano quando la correzione sarà inclusa nelle app derivate.

## Fonti e riferimenti

1. [ggml-org/llama.cpp b11292](https://github.com/ggml-org/llama.cpp/releases/tag/b11292) – llama.cpp, 2026-09-30

Ultimo aggiornamento: 2026-09-30
