Das llama.cpp-Projekt hat einen Patch veröffentlicht, der ändert, wie der Vulkan-Code 32-Bit-Gleitkommazahlen (F32) lädt. Auf Intel-GPUs ist es schneller, zwei Floats gleichzeitig statt einzeln zu laden. Deshalb nutzt die neue Logik in der Routine mul_mat_vec einen 2-fach ausgerichteten Ladevorgang. Außerdem kommt eine zuvor fehlende Ausrichtungsprüfung hinzu. Benchmarks auf einem B60-Testboard zeigen bei bestimmten Matrixgrößen bis zu 1,63 TFLOPS – eine spürbare Steigerung gegenüber der vorherigen Version.
Warum es wichtig ist
Schnellere GPU-Berechnungen ermöglichen Nutzern, die llama.cpp auf Intel-Hardware einsetzen, eine zügigere LLM-Inferenz.