Oossa

llama.cpp unterstützt BF16/FP16 in tinyBLAS auf x86-CPUs

Die Open-Source-Bibliothek llama.cpp vektorisiert jetzt die Verarbeitung von BF16-, FP16- und FP32-Restdaten im tinyBLAS-Backend und beschleunigt damit die CPU-Inferenz.

KurzmeldungOossaVon Oossa veröffentlicht: 1 Min. Lesezeit

Das Team von ggml-org hat llama.cpp in Version b11398 veröffentlicht. Die Version unterstützt die Verarbeitung von BF16-, FP16- und FP32-Restdaten im tinyBLAS-CPU-Backend auf x86-Plattformen. Außerdem werden diese Daten zur schnelleren Berechnung vektorisiert. Vorgefertigte Binärdateien gibt es für macOS (Apple Silicon und Intel), iOS sowie verschiedene Ubuntu-Architekturen. Das Update enthält Anpassungen an den Tests, damit Vergleiche mit Referenzimplementierungen genau ausfallen.

Warum es wichtig ist

Entwickler können LLM-Inferenz jetzt auch auf herkömmlichen CPUs ohne GPU-Beschleunigung schneller ausführen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.