Oossa

llama.cpp corrige el manejo de entradas BF16 en CPU

La versión b11292 añade compatibilidad con una entrada de matriz BF16 en CPU para la convolución separable y refuerza las comprobaciones de compatibilidad de Vulkan.

BreveOossaPublicado por Oossa: 1 min de lectura

La versión b11292 de llama.cpp corrige una limitación del backend de CPU que afectaba a la convolución 1D separable cuando el núcleo usa BF16, un formato numérico de 16 bits. Ahora, el backend de CPU convierte esa entrada a coma flotante de 32 bits para realizar el cálculo, en consonancia con la aritmética que usa el núcleo de multiplicación matriz-vector de Metal.

La versión también modifica las comprobaciones de Vulkan: acepta BF16 como segunda entrada de matriz solo si la primera también es BF16. Las demás combinaciones se marcan como no compatibles, para que el planificador las ejecute en CPU. Las notas mencionan que se añadieron pruebas, pero no indican cuándo llegarán los cambios a una aplicación empaquetada ni qué usuarios los recibirán.

Por qué importa

Para los desarrolladores que ejecutan convoluciones separables BF16, el backend de CPU ahora puede procesar una combinación que antes rechazaba. Las notas no especifican cuándo incluirán la corrección las aplicaciones derivadas.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.