Oossa

llama.cpp b11489 beschleunigt Q6_K-Dekodierung

Version b11489 beschleunigt die Dekodierung von Q6_K-Gewichten und erweitert das Unrolling. Neue Binärdateien gibt es für macOS, iOS und Linux.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das Team von ggml-org hat llama.cpp in Version b11489 veröffentlicht. Das Update beschleunigt die Dekodierung von Q6_K-Gewichten – dabei werden komprimierte Modellgewichte wieder in nutzbare Zahlen umgewandelt – und verdoppelt laut den Versionshinweisen den Unrolling-Faktor. Vorgefertigte Binärdateien sind jetzt für Apple Silicon, Intel-Macs, iOS und verschiedene Ubuntu-Konfigurationen verfügbar, darunter Builds mit Vulkan und CUDA.

Warum es wichtig ist

Durch die schnellere Dekodierung können Entwickler LLMs auf derselben Hardware mit geringerer Latenz ausführen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.