Das Team von ggml-org hat llama.cpp in Version b11398 veröffentlicht. Die Version unterstützt die Verarbeitung von BF16-, FP16- und FP32-Restdaten im tinyBLAS-CPU-Backend auf x86-Plattformen. Außerdem werden diese Daten zur schnelleren Berechnung vektorisiert. Vorgefertigte Binärdateien gibt es für macOS (Apple Silicon und Intel), iOS sowie verschiedene Ubuntu-Architekturen. Das Update enthält Anpassungen an den Tests, damit Vergleiche mit Referenzimplementierungen genau ausfallen.
Warum es wichtig ist
Entwickler können LLM-Inferenz jetzt auch auf herkömmlichen CPUs ohne GPU-Beschleunigung schneller ausführen.