Oossa

llama.cpp añade compatibilidad con BF16 y FP16 en tinyBLAS para x86

La biblioteca de código abierto llama.cpp ahora vectoriza los datos residuales BF16, FP16 y FP32 en su backend tinyBLAS, lo que acelera la inferencia en CPU.

BreveOossaPublicado por Oossa: 1 min de lectura

El equipo de ggml-org publicó la versión b11398 de llama.cpp. La actualización añade compatibilidad con el procesamiento de datos residuales BF16, FP16 y FP32 en el backend tinyBLAS para CPU, en plataformas x86. También vectoriza esos datos para acelerar los cálculos. Se ofrecen binarios precompilados para macOS (Apple Silicon e Intel), iOS y varias arquitecturas de Ubuntu. La actualización también incluye ajustes en las pruebas para garantizar comparaciones precisas con implementaciones de referencia.

Por qué importa

Los desarrolladores ahora pueden ejecutar inferencias de LLM más rápido en CPU convencionales, sin aceleración por GPU.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.