llama.cpp प्रोजेक्ट ने एक पैच जारी किया है, जो Vulkan कोड में 32-बिट फ्लोट (F32) लोड करने का तरीका बदलता है। Intel GPU पर एक-एक करके फ्लोट लोड करने के बजाय दो फ्लोट साथ लोड करना तेज़ है, इसलिए नए लॉजिक में mul_mat_vec रूटीन के लिए 2-अलाइन लोड का इस्तेमाल किया गया है। इस बदलाव में एक छूटी हुई अलाइनमेंट जांच भी जोड़ी गई है। B60 टेस्ट बोर्ड पर किए गए बेंचमार्क में कुछ मैट्रिक्स आकारों के लिए 1.63 TFLOPS तक की गति दर्ज हुई, जो पिछले संस्करण से उल्लेखनीय बढ़त है।
यह क्यों मायने रखता है
GPU पर तेज़ गणना का मतलब है कि Intel हार्डवेयर पर llama.cpp चलाने वाले उपयोगकर्ताओं के लिए LLM इन्फरेंस तेज़ होगा।