Oossa

llama.cpp accélère tinyBLAS sur les processeurs x86

La bibliothèque open source llama.cpp vectorise désormais le traitement des données résiduelles en BF16, FP16 et FP32 dans son backend tinyBLAS, pour accélérer l’inférence sur CPU.

BrèveOossaPublié par Oossa: 1 min de lecture

L’équipe ggml-org a publié la version b11398 de llama.cpp. Elle ajoute la prise en charge du traitement des données résiduelles en BF16, FP16 et FP32 dans le backend CPU tinyBLAS sur les plateformes x86. Ces données sont également vectorisées afin d’accélérer les calculs. Des binaires précompilés sont disponibles pour macOS (Apple Silicon et Intel), iOS et plusieurs architectures Ubuntu. La mise à jour apporte aussi des ajustements aux tests pour garantir des comparaisons précises avec les implémentations de référence.

Pourquoi c'est important

Les développeurs peuvent désormais accélérer l’inférence de LLM sur des processeurs classiques, sans accélération par GPU.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.