NVIDIA के शोधकर्ताओं ने PivotOPD नाम की एक नई प्रशिक्षण विधि की घोषणा की। यह ऑन-पॉलिसी डिस्टिलेशन तकनीक है—यानी AI को उससे संवाद करते हुए सिखाने का तरीका—जिसे बहु-चरणीय LLM एजेंट्स के लिए बनाया गया है। यह विधि एजेंट्स को संवाद के शुरुआती दौर में अहम गलतियां पहचानने और उनसे उबरने की सीख देती है। परीक्षणों में, तीन मानक एजेंट बेंचमार्क पर 13 प्रतिस्पर्धी तरीकों में PivotOPD का औसत स्कोर सबसे अधिक रहा।
यह क्यों मायने रखता है
गलतियों से बेहतर ढंग से उबरने की क्षमता से उन उपयोगकर्ताओं के लिए संवादात्मक AI टूल अधिक भरोसेमंद हो सकते हैं जिन्हें लंबे और कई चरणों वाले संवाद की जरूरत होती है।