# llama.cpp में टेंसर कॉपी घटाने का मेमोरी-मैप विकल्प

> ओपन-सोर्स LLM रनटाइम अब मॉडल का डेटा सीधे मैप करने देता है, जिससे macOS, iOS और Linux बिल्ड में RAM की बचत होती है।

Oossa · 2026-10-01 · https://oossa.com/hi/llama-cpp-release-adds-memory-map-option-to-cut-tensor-copies

ggml-org टीम ने llama.cpp का b11324 संस्करण जारी किया है। इस अपडेट में मेमोरी-मैप मोड जोड़ा गया है, जिससे मॉडल लोड करते समय हर टेंसर की पूरी आकार वाली दूसरी कॉपी बनाने की ज़रूरत नहीं पड़ती। यह बदलाव macOS (Apple Silicon और Intel), iOS और Ubuntu के कई बिल्ड के नए बाइनरी पैकेज में उपलब्ध है। रिलीज़ में Claude और NVIDIA के इंजीनियर Pranesh Gonegandla के योगदान का भी उल्लेख है।

## तथ्य

- रिलीज़ संस्करण b11324, 2026-10-01 को प्रकाशित हुआ
- RAM का इस्तेमाल घटाने के लिए llama-mmap फ़ीचर जोड़ा गया

## यह क्यों मायने रखता है

डेवलपर उसी हार्डवेयर पर बड़े भाषा मॉडल चला सकते हैं। इससे सीमित मेमोरी वाले शौकीनों और छोटी टीमों को मदद मिलती है।

## स्रोत और संदर्भ

1. [ggml-org/llama.cpp b11324](https://github.com/ggml-org/llama.cpp/releases/tag/b11324) – llama.cpp, 2026-10-01

अंतिम अपडेट: 2026-10-01
