ggml-org a publié la version b11537 de llama.cpp. Cette mise à jour réorganise l’opération get_rows du graphe pour les embeddings et corrige la gestion des embeddings de Gemma4. Elle ajoute aussi une note TODO concernant la prise en charge de LoRA et corrige les chemins des embeddings bruts. Des binaires précompilés sont désormais disponibles pour macOS sur Apple Silicon et processeurs Intel, iOS et différentes versions d’Ubuntu, notamment avec Vulkan.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter llama.cpp en local sur davantage de plateformes et profiter d’une prise en charge des embeddings corrigée, ce qui simplifie l’installation.