Oossa

llama.cpp b11494 optimise les warps CUDA

La bibliothèque open source llama.cpp utilise désormais quatre colonnes d’état GDN par warp CUDA, pour de meilleures performances GPU.

BrèvePar Publié par Oossa: 1 min de lecture

L’équipe ggml-org a publié la version b11494 de llama.cpp. Cette mise à jour modifie le backend CUDA : chaque warp traite désormais quatre colonnes d’état GDN au lieu de deux. Ce réglage est maintenant activé par défaut. Des binaires pour macOS (Apple Silicon et Intel), iOS et plusieurs versions d’Ubuntu sont disponibles au téléchargement.

Pourquoi c'est important

Les développeurs qui utilisent llama.cpp sur des GPU NVIDIA peuvent s’attendre à une inférence plus rapide, sans modifier leur code.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.