Das Team von ggml-org hat llama.cpp in Version b11487 veröffentlicht. Das Update ergänzt die Unterstützung für GET_ROWS mit gekacheltem Q4_K und Q6_K auf Hexagon-Prozessoren und verbessert den Umgang mit Q4_K-Views. Vorgefertigte Binärdateien stehen für Apple Silicon, Intel-macs, iOS sowie mehrere Ubuntu-Versionen (CPU und Vulkan) bereit. Das Update lässt sich von der GitHub-Release-Seite herunterladen.
Warum es wichtig ist
Entwickler können effizientere Llama-Modelle nun auf Geräten mit Hexagon-Prozessoren, etwa Qualcomm-Chips, ausführen. Das verbessert die Leistung auf unterstützter Mobil- und Embedded-Hardware.