El equipo de ggml‑org lanzó la versión b11489 de llama.cpp. La actualización acelera la descompresión de pesos Q6_K —un paso que convierte los pesos comprimidos del modelo en números utilizables— y duplica el factor de desenrollado, según las notas de la versión. Ya están disponibles los binarios precompilados para Apple Silicon, Intel macOS, iOS y varias configuraciones de Ubuntu, incluidas las compilaciones para Vulkan y CUDA.
Por qué importa
La descompresión más rápida permite a los desarrolladores ejecutar LLM en el mismo hardware con menor latencia.