El equipo de ggml-org publicó la versión b11324 de llama.cpp. La actualización incorpora un modo de mapeo de memoria que evita crear una segunda copia completa de cada tensor al cargar modelos. La función está disponible en los nuevos paquetes binarios para macOS (Apple Silicon e Intel), iOS y varias versiones de Ubuntu. En las notas de la versión también se reconocen las contribuciones de Claude y de Pranesh Gonegandla, ingeniero de NVIDIA.
Por qué importa
Los desarrolladores pueden ejecutar modelos de lenguaje más grandes con el mismo hardware, algo útil para aficionados y equipos pequeños con memoria limitada.