# llama.cpp में macOS के लिए Metal flash-attention kernels

> ओपन-सोर्स LLM रनटाइम ने 9 अक्टूबर 2026 को Apple Silicon के लिए 128/96 flash-attention सपोर्ट वाले नए बाइनरी जारी किए।

Oossa · 2026-10-09 · https://oossa.com/hi/llama-cpp-adds-flash-attention-kernels-for-metal-on-macos

ggml-org टीम ने 9 अक्टूबर 2026 को llama.cpp (रिलीज़ b11518) अपडेट किया। इस अपडेट में Metal के लिए 128-bit और 96-bit flash-attention kernels जोड़े गए हैं, जिससे Apple Silicon Mac पर इन्फ़रेंस तेज़ होता है। macOS (arm64), macOS Intel, iOS और Linux के कई कॉन्फ़िगरेशन के लिए पहले से तैयार बाइनरी डाउनलोड के लिए उपलब्ध हैं।

## तथ्य

- रिलीज़ टैग b11518 शुक्रवार, 9 अक्टूबर 2026 को प्रकाशित हुआ
- Apple Silicon के लिए Metal flash-attention kernels (128/96) जोड़े गए

## यह क्यों मायने रखता है

Apple Silicon इस्तेमाल करने वाले लोग अतिरिक्त GPU हार्डवेयर खरीदे बिना LLM तेज़ी से चला सकते हैं।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11518](https://github.com/ggml-org/llama.cpp/releases/tag/b11518) – llama.cpp, 2026-10-09

अंतिम अपडेट: 2026-10-09
