Das Team von ggml-org hat am 29. September 2026 llama.cpp in Version b11262 veröffentlicht. Das Update ergänzt die Unterstützung für AVX512‑FP16. Damit lassen sich Dot-Produkte mit halber Genauigkeit (f16) berechnen und die Ergebnisse für höhere Genauigkeit mit einfacher Genauigkeit (f32) aufsummieren. Die Änderung auf niedriger Ebene beschleunigt die Inferenz auf CPUs, die den Befehlssatz AVX512‑FP16 unterstützen. Außerdem enthält die Veröffentlichung neue Binärdateien für macOS, iOS und mehrere Linux-Varianten.
Warum es wichtig ist
Entwickler können damit LLMs auf modernen CPUs schneller ausführen, ohne Einbußen bei der numerischen Genauigkeit.