El equipo de ggml‑org publicó llama.cpp versión b11262 el 29 de septiembre de 2026. La actualización añade compatibilidad con AVX512‑FP16, que calcula productos punto de precisión media (f16) y acumula los resultados en precisión simple (f32) para mejorar la exactitud. Es un cambio de bajo nivel que acelera la inferencia en CPU compatibles con el conjunto de instrucciones AVX512‑FP16. La versión también incluye nuevos binarios para macOS, iOS y varias distribuciones de Linux.
Por qué importa
Permite a los desarrolladores ejecutar modelos de lenguaje grandes más rápido en CPU modernas sin perder precisión numérica.