# llama.cpp corrige el manejo de entradas BF16 en CPU

> La versión b11292 añade compatibilidad con una entrada de matriz BF16 en CPU para la convolución separable y refuerza las comprobaciones de compatibilidad de Vulkan.

Oossa · 2026-09-30 · https://oossa.com/es/llama-cpp-fixes-cpu-handling-for-bf16-matrix-inputs

Creado y traducido con ayuda de IA. Consulta las fuentes originales abajo.

La versión b11292 de llama.cpp corrige una limitación del backend de CPU que afectaba a la convolución 1D separable cuando el núcleo usa BF16, un formato numérico de 16 bits. Ahora, el backend de CPU convierte esa entrada a coma flotante de 32 bits para realizar el cálculo, en consonancia con la aritmética que usa el núcleo de multiplicación matriz-vector de Metal.

La versión también modifica las comprobaciones de Vulkan: acepta BF16 como segunda entrada de matriz solo si la primera también es BF16. Las demás combinaciones se marcan como no compatibles, para que el planificador las ejecute en CPU. Las notas mencionan que se añadieron pruebas, pero no indican cuándo llegarán los cambios a una aplicación empaquetada ni qué usuarios los recibirán.

## Los hechos

- La versión es llama.cpp b11292, publicada el 30 de septiembre de 2026.
- Las notas incluyen una prueba de convolución separable con núcleos F32, F16 y BF16, además de tres casos de multiplicación de matrices con BF16 como segunda entrada.

## Por qué importa

Para los desarrolladores que ejecutan convoluciones separables BF16, el backend de CPU ahora puede procesar una combinación que antes rechazaba. Las notas no especifican cuándo incluirán la corrección las aplicaciones derivadas.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11292](https://github.com/ggml-org/llama.cpp/releases/tag/b11292) – llama.cpp, 2026-09-30

Última actualización: 2026-09-30
