# llama.cpp में Intel Vulkan बिल्ड के लिए 2-अलाइन F32 लोड

> इस अपडेट से Intel GPU पर एक बार में दो फ्लोट लोड करके मैट्रिक्स गुणा की रफ्तार बढ़ती है।

Oossa · 2026-09-30 · https://oossa.com/hi/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

llama.cpp प्रोजेक्ट ने एक पैच जारी किया है, जो Vulkan कोड में 32-बिट फ्लोट (F32) लोड करने का तरीका बदलता है। Intel GPU पर एक-एक करके फ्लोट लोड करने के बजाय दो फ्लोट साथ लोड करना तेज़ है, इसलिए नए लॉजिक में mul_mat_vec रूटीन के लिए 2-अलाइन लोड का इस्तेमाल किया गया है। इस बदलाव में एक छूटी हुई अलाइनमेंट जांच भी जोड़ी गई है। B60 टेस्ट बोर्ड पर किए गए बेंचमार्क में कुछ मैट्रिक्स आकारों के लिए 1.63 TFLOPS तक की गति दर्ज हुई, जो पिछले संस्करण से उल्लेखनीय बढ़त है।

## तथ्य

- पैच 30 सितंबर, 2026 को जारी हुआ (b11266)
- 4096×8×14336 मैट्रिक्स पर 1.63 TFLOPS तक की गति

## यह क्यों मायने रखता है

GPU पर तेज़ गणना का मतलब है कि Intel हार्डवेयर पर llama.cpp चलाने वाले उपयोगकर्ताओं के लिए LLM इन्फरेंस तेज़ होगा।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

अंतिम अपडेट: 2026-09-30
