संक्षिप्त · 1 मिनट पढ़ना
सॉफ्ट-प्रॉम्प्ट ट्यूनिंग से LLM बेंचमार्क का ध्यान फॉर्मैट के बजाय ज्ञान पर रहता है
Aleph Alpha ने दिखाया कि सिर्फ़ दस छोटे वेक्टरों को एक मिनट तक ट्रेन करने से बेस मॉडल सही फॉर्मैट में जवाब दे सकते हैं और उनके स्कोर ज़्यादा स्पष्ट मिलते हैं।
Oossa · Oossa के बारे में
Aleph Alpha ने एक ऐसी विधि जारी की है जिसमें सिर्फ़ कुछ सीखने योग्य वेक्टरों—जिन्हें सॉफ्ट प्रॉम्प्ट कहा जाता है—में बदलाव करके एक स्थिर लैंग्वेज मॉडल को बेंचमार्क के अपेक्षित जवाब के सटीक फॉर्मैट में प्रशिक्षित किया जाता है। इस ट्यूनिंग में करीब 80 स्टेप लगते हैं; 7 बिलियन पैरामीटर वाले मॉडल के लिए इसमें लगभग 1.5 मिनट लगते हैं। इससे फॉर्मैट का पालन करने की सटीकता लगभग 100 प्रतिशत तक पहुँच जाती है, जबकि मॉडल का ज्ञान नहीं बदलता।
मॉडल के ज्ञान का स्कोर जस का तस रहते हुए फॉर्मैटिंग बेहतर होती है, इसलिए शोधकर्ता बेस मॉडल की निष्पक्ष तुलना कर सकते हैं और अनुमान लगा सकते हैं कि पूरी पोस्ट-ट्रेनिंग के बाद उनकी रैंकिंग क्या होगी। इससे कंप्यूटिंग में कई हफ्तों की बचत होती है।
यह क्यों मायने रखता है
इससे डेवलपर महंगी और पूरी ट्रेनिंग किए बिना मॉडलों का तेज़ी से मूल्यांकन और रैंकिंग कर सकते हैं और इस बात पर ध्यान दे सकते हैं कि मॉडल वास्तव में क्या जानता है।
स्रोत और संदर्भ
| # | स्रोत | प्रकाशक | तारीख | मुख्य बात |
|---|---|---|---|---|
| 1 | Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation ↗ | Aleph Alpha | 29 सित॰ 2026 |
1 स्रोत
अंतिम अपडेट:
Oossa · न्यूज़लेटर
AI का हफ़्ता, आसान भाषा में
हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।