शोधकर्ताओं ने पाया है कि बड़े भाषा मॉडल जवाब सही है या नहीं, इसका एक ज्यामितीय संकेत अपने भीतर संजोकर रखते हैं। गलत से सही जवाबों की ओर छिपी अवस्थाओं में होने वाले औसत बदलाव को देखकर वे एक ऐसा स्कोरिंग वेक्टर बना सकते हैं, जो बिना किसी फ़ाइन-ट्यूनिंग के संभावित जवाबों की रैंकिंग करता है। 1 बिलियन से 8 बिलियन पैरामीटर वाले पांच मॉडलों पर किए गए परीक्षण में, यह तकनीक ARC‑Challenge और MMLU पर सामान्य ज़ीरो-शॉट लॉग-प्रॉबेबिलिटी तरीके से 32 अंक तक और TruthfulQA पर 52 अंक तक बेहतर रही।
यह तरीका कैसे काम करता है
लेखक सही-गलत के लेबल वाले पचास उदाहरण लेते हैं, उन्हें मॉडल से गुज़ारकर नेटवर्क की लगभग आधी गहराई पर छिपी प्रस्तुतियां इकट्ठा करते हैं, और फिर गलत जवाबों की अवस्था से सही जवाबों की अवस्था की ओर इशारा करने वाला औसत वेक्टर निकालते हैं। अनुमान के समय जवाब के हर विकल्प के लिए बस एक फ़ॉरवर्ड पास और इस वेक्टर के साथ एक डॉट प्रोडक्ट की ज़रूरत होती है। जवाब का टेक्स्ट तैयार नहीं किया जाता और मॉडल के पैरामीटर भी नहीं बदले जाते।
मॉडल की विश्वसनीयता पर असर
भ्रमित करने वाले जवाबों का पता लगाने में इस्तेमाल करने पर, यह ज्यामितीय दिशा 0.693 का AUROC हासिल करती है, जबकि सामान्य प्रायिकता स्कोरिंग का AUROC 0.578 है। अध्ययन यह भी दिखाता है कि तथ्यात्मक तर्क, विषय-ज्ञान और सत्यनिष्ठा से जुड़े सही जवाब के संकेत लगभग एक-दूसरे के लंबवत उप-स्थान में होते हैं। इसका मतलब है कि मॉडल अलग-अलग तरह की शुद्धता के लिए अलग संकेत रखते हैं। इससे यह समझने में मदद मिल सकती है कि मॉडल अक्सर भीतर ही भीतर सही जवाब जानते हैं, लेकिन उसे बता नहीं पाते।
यह क्यों मायने रखता है
आम उपयोगकर्ताओं के लिए, इस तकनीक से चैटबॉट खासकर तथ्यात्मक सवालों पर अधिक भरोसेमंद जवाब दे सकते हैं। यह महंगी गणना के बिना संभावित भ्रामक जवाबों को पहचानने का तरीका भी सुझाती है। हालांकि, इसके लिए मॉडल की छिपी अवस्थाओं तक पहुंच चाहिए, जो ज़्यादातर सार्वजनिक API में उपलब्ध नहीं होती।