L’équipe ggml-org a publié la version b11398 de llama.cpp. Elle ajoute la prise en charge du traitement des données résiduelles en BF16, FP16 et FP32 dans le backend CPU tinyBLAS sur les plateformes x86. Ces données sont également vectorisées afin d’accélérer les calculs. Des binaires précompilés sont disponibles pour macOS (Apple Silicon et Intel), iOS et plusieurs architectures Ubuntu. La mise à jour apporte aussi des ajustements aux tests pour garantir des comparaisons précises avec les implémentations de référence.
Pourquoi c'est important
Les développeurs peuvent désormais accélérer l’inférence de LLM sur des processeurs classiques, sans accélération par GPU.