llama.cpp projesi, Vulkan kodunun 32 bit kayan nokta sayılarını (F32) yükleme biçimini değiştiren bir yama yayımladı. Intel GPU’larda iki sayıyı birlikte yüklemek, sayıları teker teker yüklemekten daha hızlı olduğundan yeni mantık, mul_mat_vec rutininde 2 hizalı yükleme kullanıyor. Değişiklik ayrıca eksik olan bir hizalama denetimini de ekliyor. B60 test kartında yapılan kıyaslamalarda, belirli matris boyutlarında 1,63 TFLOPS’a kadar performans elde edildi; bu, önceki sürüme kıyasla kayda değer bir artış.
Neden önemli
Daha hızlı GPU hesaplamaları, llama.cpp’yi Intel donanımında kullananların büyük dil modellerini (LLM) daha hızlı çalıştırmasını sağlar.