El equipo de ggml-org publicó la versión b11531 de llama.cpp. La actualización renueva la API de chat e incluye binarios precompilados para macOS (Apple Silicon e Intel), iOS y varias versiones de Ubuntu, con opciones para CPU, Vulkan y CUDA 12.8. Los enlaces de descarga están en la página de la versión en GitHub. Ahora los usuarios pueden ejecutar LLM de forma local en más plataformas sin tener que compilar el software.
Por qué importa
Los desarrolladores pueden ejecutar modelos Llama de forma local en más dispositivos desde hoy, sin tener que compilar el software y con aceleración por GPU en Ubuntu.