# llama.cpp में Vulkan के लिए डुप्लिकेट रो वाली नई ऑप्टिमाइज़ेशन

> ओपन-सोर्स LLaMA इंफरेंस लाइब्रेरी अब GPU पर रो दोहरने पर अनावश्यक गणनाएं छोड़ देती है, जिससे Vulkan डिवाइस पर रफ्तार बढ़ती है।

Oossa · 2026-10-11 · https://oossa.com/hi/llama-cpp-adds-vulkan-duplicate-row-optimizations

llama.cpp प्रोजेक्ट ने 2026‑10‑11 को संस्करण b11554 जारी किया। इस अपडेट में Vulkan के लिए ऐसे सुधार जोड़े गए हैं, जो मैट्रिक्स गुणा के दौरान डुप्लिकेट रो ID पहचानकर उन्हें बार-बार प्रोसेस करने के बजाय पहले ही संभालते हैं। साथ ही, “hoist row ids” ऑप्टिमाइज़ेशन को बेहतर बनाया गया है, ताकि यह हमेशा चले और कई कॉम्पैक्ट टाइल बना सके। इन बदलावों से GPU कम वर्क-ग्रुप लॉन्च कर सकता है और जहां संभव हो, जल्दी काम रोक सकता है।

## तथ्य

- संस्करण b11554 रविवार, 11 अक्टूबर 2026 को जारी हुआ
- llama.cpp में Vulkan के लिए डुप्लिकेट रो संभालने की सुविधा जोड़ी गई

## यह क्यों मायने रखता है

llama.cpp इस्तेमाल करने वाले GPU यूज़रों को तेज़ इंफरेंस मिल सकता है, क्योंकि लाइब्रेरी अब एक जैसी गणनाएं दोहराने से बचती है।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

अंतिम अपडेट: 2026-10-11
