# सॉफ्ट-प्रॉम्प्ट ट्यूनिंग से LLM बेंचमार्क का ध्यान फॉर्मैट के बजाय ज्ञान पर रहता है

> Aleph Alpha ने दिखाया कि सिर्फ़ दस छोटे वेक्टरों को एक मिनट तक ट्रेन करने से बेस मॉडल सही फॉर्मैट में जवाब दे सकते हैं और उनके स्कोर ज़्यादा स्पष्ट मिलते हैं।

Oossa · 2026-09-29 · https://oossa.com/hi/soft-prompt-tuning-helps-llm-benchmarks-focus-on-knowledge-not-format

Aleph Alpha ने एक ऐसी विधि जारी की है जिसमें सिर्फ़ कुछ सीखने योग्य वेक्टरों—जिन्हें सॉफ्ट प्रॉम्प्ट कहा जाता है—में बदलाव करके एक स्थिर लैंग्वेज मॉडल को बेंचमार्क के अपेक्षित जवाब के सटीक फॉर्मैट में प्रशिक्षित किया जाता है। इस ट्यूनिंग में करीब 80 स्टेप लगते हैं; 7 बिलियन पैरामीटर वाले मॉडल के लिए इसमें लगभग 1.5 मिनट लगते हैं। इससे फॉर्मैट का पालन करने की सटीकता लगभग 100 प्रतिशत तक पहुँच जाती है, जबकि मॉडल का ज्ञान नहीं बदलता।

मॉडल के ज्ञान का स्कोर जस का तस रहते हुए फॉर्मैटिंग बेहतर होती है, इसलिए शोधकर्ता बेस मॉडल की निष्पक्ष तुलना कर सकते हैं और अनुमान लगा सकते हैं कि पूरी पोस्ट-ट्रेनिंग के बाद उनकी रैंकिंग क्या होगी। इससे कंप्यूटिंग में कई हफ्तों की बचत होती है।

## तथ्य

- 10 सॉफ्ट-प्रॉम्प्ट वेक्टर, 7 B मॉडल के कुल पैरामीटर का 0.0006 % हैं
- ट्रेनिंग में ~80 स्टेप लगते हैं; 7 B मॉडल पर इसमें लगभग 1.5 मिनट लगते हैं

## यह क्यों मायने रखता है

इससे डेवलपर महंगी और पूरी ट्रेनिंग किए बिना मॉडलों का तेज़ी से मूल्यांकन और रैंकिंग कर सकते हैं और इस बात पर ध्यान दे सकते हैं कि मॉडल वास्तव में क्या जानता है।

## स्रोत और संदर्भ

1. [Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation](https://www.aleph-alpha.com/en/blog/soft-prompt-tuning-for-fair-and-efficient-llm-benchmark-evaluation/) – Aleph Alpha, 2026-09-29

अंतिम अपडेट: 2026-09-29
