El equipo de ggml-org publicó la versión b11398 de llama.cpp. La actualización añade compatibilidad con el procesamiento de datos residuales BF16, FP16 y FP32 en el backend tinyBLAS para CPU, en plataformas x86. También vectoriza esos datos para acelerar los cálculos. Se ofrecen binarios precompilados para macOS (Apple Silicon e Intel), iOS y varias arquitecturas de Ubuntu. La actualización también incluye ajustes en las pruebas para garantizar comparaciones precisas con implementaciones de referencia.
Por qué importa
Los desarrolladores ahora pueden ejecutar inferencias de LLM más rápido en CPU convencionales, sin aceleración por GPU.