# ज्यामितीय स्कोरिंग से भाषा मॉडल के जवाब अधिक सही

> एक नई विधि मॉडल की छिपी अवस्थाओं में ऐसी दिशा खोजती है, जो जवाबों की रैंकिंग सामान्य प्रायिकता स्कोरिंग से 52 अंक तक बेहतर करती है।

Oossa · 2026-10-06 · https://oossa.com/hi/geometric-scoring-boosts-answer-correctness-in-language-models

शोधकर्ताओं ने पाया है कि बड़े भाषा मॉडल जवाब सही है या नहीं, इसका एक ज्यामितीय संकेत अपने भीतर संजोकर रखते हैं। गलत से सही जवाबों की ओर छिपी अवस्थाओं में होने वाले औसत बदलाव को देखकर वे एक ऐसा स्कोरिंग वेक्टर बना सकते हैं, जो बिना किसी फ़ाइन-ट्यूनिंग के संभावित जवाबों की रैंकिंग करता है। 1 बिलियन से 8 बिलियन पैरामीटर वाले पांच मॉडलों पर किए गए परीक्षण में, यह तकनीक ARC‑Challenge और MMLU पर सामान्य ज़ीरो-शॉट लॉग-प्रॉबेबिलिटी तरीके से 32 अंक तक और TruthfulQA पर 52 अंक तक बेहतर रही।

## यह तरीका कैसे काम करता है

लेखक सही-गलत के लेबल वाले पचास उदाहरण लेते हैं, उन्हें मॉडल से गुज़ारकर नेटवर्क की लगभग आधी गहराई पर छिपी प्रस्तुतियां इकट्ठा करते हैं, और फिर गलत जवाबों की अवस्था से सही जवाबों की अवस्था की ओर इशारा करने वाला औसत वेक्टर निकालते हैं। अनुमान के समय जवाब के हर विकल्प के लिए बस एक फ़ॉरवर्ड पास और इस वेक्टर के साथ एक डॉट प्रोडक्ट की ज़रूरत होती है। जवाब का टेक्स्ट तैयार नहीं किया जाता और मॉडल के पैरामीटर भी नहीं बदले जाते।

## मॉडल की विश्वसनीयता पर असर

भ्रमित करने वाले जवाबों का पता लगाने में इस्तेमाल करने पर, यह ज्यामितीय दिशा 0.693 का AUROC हासिल करती है, जबकि सामान्य प्रायिकता स्कोरिंग का AUROC 0.578 है। अध्ययन यह भी दिखाता है कि तथ्यात्मक तर्क, विषय-ज्ञान और सत्यनिष्ठा से जुड़े सही जवाब के संकेत लगभग एक-दूसरे के लंबवत उप-स्थान में होते हैं। इसका मतलब है कि मॉडल अलग-अलग तरह की शुद्धता के लिए अलग संकेत रखते हैं। इससे यह समझने में मदद मिल सकती है कि मॉडल अक्सर भीतर ही भीतर सही जवाब जानते हैं, लेकिन उसे बता नहीं पाते।

## तथ्य

- यह तरीका ARC‑Challenge और MMLU पर ज़ीरो-शॉट स्कोरिंग में 32.0 प्रतिशत अंक तक सुधार करता है।
- TruthfulQA पर बढ़त 38.1 से 51.8 प्रतिशत अंक तक है।
- 1 B से 8 B पैरामीटर वाले और Llama, Qwen तथा Gemma के तीन परिवारों से जुड़े पांच मॉडलों पर परीक्षण किया गया।
- इसके लिए सही-गलत के लेबल वाले केवल पचास उदाहरण चाहिए; मॉडल के पैरामीटर अपडेट नहीं किए जाते।
- भ्रमित करने वाले जवाबों का पता लगाने में इस तरीके का AUROC 0.693 है, जबकि लॉग-प्रॉबेबिलिटी स्कोरिंग का 0.578 है।

## यह क्यों मायने रखता है

आम उपयोगकर्ताओं के लिए, इस तकनीक से चैटबॉट खासकर तथ्यात्मक सवालों पर अधिक भरोसेमंद जवाब दे सकते हैं। यह महंगी गणना के बिना संभावित भ्रामक जवाबों को पहचानने का तरीका भी सुझाती है। हालांकि, इसके लिए मॉडल की छिपी अवस्थाओं तक पहुंच चाहिए, जो ज़्यादातर सार्वजनिक API में उपलब्ध नहीं होती।

## स्रोत और संदर्भ

1. [Correctness Is a Direction: Geometric Answer Selection in Language Models](https://arxiv.org/abs/2610.04512) – arXiv, 2026-10-06

अंतिम अपडेट: 2026-10-06
