OossaAI तेज़ी से विकसित हो रहा है। हम इसे आसान भाषा में समझाते हैं।

llama.cpp में Intel Vulkan बिल्ड के लिए 2-अलाइन F32 लोड

इस अपडेट से Intel GPU पर एक बार में दो फ्लोट लोड करके मैट्रिक्स गुणा की रफ्तार बढ़ती है।

संक्षिप्तOossa1 मिनट पढ़ना

llama.cpp प्रोजेक्ट ने एक पैच जारी किया है, जो Vulkan कोड में 32-बिट फ्लोट (F32) लोड करने का तरीका बदलता है। Intel GPU पर एक-एक करके फ्लोट लोड करने के बजाय दो फ्लोट साथ लोड करना तेज़ है, इसलिए नए लॉजिक में mul_mat_vec रूटीन के लिए 2-अलाइन लोड का इस्तेमाल किया गया है। इस बदलाव में एक छूटी हुई अलाइनमेंट जांच भी जोड़ी गई है। B60 टेस्ट बोर्ड पर किए गए बेंचमार्क में कुछ मैट्रिक्स आकारों के लिए 1.63 TFLOPS तक की गति दर्ज हुई, जो पिछले संस्करण से उल्लेखनीय बढ़त है।

यह क्यों मायने रखता है

GPU पर तेज़ गणना का मतलब है कि Intel हार्डवेयर पर llama.cpp चलाने वाले उपयोगकर्ताओं के लिए LLM इन्फरेंस तेज़ होगा।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।

स्रोत और संदर्भ

#स्रोतप्रकाशकतारीखमुख्य बात
1ggml-org/llama.cpp b11266 ↗llama.cpp29 सित॰ 2026<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30 सित॰ 2026<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 स्रोत

अंतिम अपडेट: ·Markdown·llms.txt