أعلن باحثون في NVIDIA عن أسلوب تدريب جديد يُسمى PivotOPD. وهو تقنية تقطير على السياسة، أي أسلوب لتعليم الذكاء الاصطناعي أثناء تفاعله، صُممت لوكلاء النماذج اللغوية الكبيرة الذين يخوضون حوارات متعددة الأدوار. وتدرّب هذه التقنية الوكلاء على رصد الأخطاء الحاسمة في بداية الحوار والتعافي منها. وفي الاختبارات، حقق PivotOPD أعلى متوسط درجات بين 13 نهجًا منافسًا عبر ثلاثة معايير قياسية لتقييم الوكلاء.
لماذا يهم
قد يجعل تحسين القدرة على تصحيح الأخطاء أدوات الذكاء الاصطناعي الحوارية أكثر موثوقية للمستخدمين الذين يحتاجون إلى تفاعلات أطول ومتعددة الخطوات.