Oossa

llama.cpp b11494 optimiert CUDA-Warps

Die Open-Source-Bibliothek llama.cpp nutzt jetzt vier GDN-State-Spalten pro CUDA-Warp und verbessert damit die GPU-Leistung.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das ggml-org-Team hat llama.cpp in Version b11494 veröffentlicht. Das Update ändert das CUDA-Backend: Es weist jedem Warp nun vier statt zwei GDN-State-Spalten zu. Diese Einstellung ist jetzt der Standard. Binaries für macOS (Apple Silicon und Intel), iOS und verschiedene Ubuntu-Versionen stehen zum Download bereit.

Warum es wichtig ist

Entwickler, die llama.cpp auf NVIDIA-GPUs nutzen, können mit schnellerer Inferenz rechnen, ohne ihren Code ändern zu müssen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.