Oossa

امتیازدهی هندسی، درستی پاسخ مدل‌های زبانی را بهبود می‌دهد

روشی تازه، جهتی را در حالت‌های پنهان مدل پیدا می‌کند که پاسخ‌ها را تا ۵۲ واحد بهتر از امتیازدهی معمول بر پایه احتمال رتبه‌بندی می‌کند.

نویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

Domenico Loia · Unsplash

پژوهشگران دریافته‌اند که مدل‌های زبانی بزرگ نشانه‌ای هندسی برای تشخیص درستی پاسخ‌ها در خود دارند. با بررسی میانگین تغییر حالت‌های پنهان از پاسخ‌های نادرست به درست، می‌توان برداری برای امتیازدهی ساخت که بدون هیچ تنظیم دقیق، پاسخ‌های پیشنهادی را رتبه‌بندی کند. این روش که روی پنج مدل با ۱ تا ۸ میلیارد پارامتر آزمایش شده، در ARC‑Challenge و MMLU تا ۳۲ واحد و در TruthfulQA تا ۵۲ واحد بهتر از روش معمولِ احتمال لگاریتمیِ بدون نمونه‌برداری عمل می‌کند.

روش کار

پژوهشگران ۵۰ نمونه برچسب‌گذاری‌شده را وارد مدل می‌کنند، بازنمایی‌های پنهان را در لایه‌ای حدوداً میانی از شبکه جمع‌آوری می‌کنند و بردار میانگینی را محاسبه می‌کنند که از حالت‌های مربوط به پاسخ نادرست به حالت‌های پاسخ درست اشاره دارد. هنگام اجرا، هر پاسخ پیشنهادی تنها به یک بار عبور از مدل و یک ضرب داخلی با این بردار نیاز دارد. متنی به‌عنوان پاسخ تولید نمی‌شود و هیچ‌یک از پارامترهای مدل تغییر نمی‌کند.

پیامدها برای اعتمادپذیری مدل

این جهت هندسی، وقتی به‌عنوان آشکارساز توهم به کار می‌رود، به AUROC برابر با ۰٫۶۹۳ می‌رسد؛ درحالی‌که این رقم برای امتیازدهی معمول بر پایه احتمال ۰٫۵۷۸ است. این پژوهش همچنین نشان می‌دهد نشانه‌های درستی در استدلال واقع‌محور، دانش حوزه‌ای و راست‌گویی، در زیرفضاهایی تقریباً متعامد قرار دارند؛ یعنی مدل‌ها برای انواع مختلف درستی، سیگنال‌های جداگانه‌ای حفظ می‌کنند. این یافته شاید توضیح دهد چرا مدل‌ها اغلب پاسخ درست را درونی می‌دانند، اما در ارائه آن ناکام می‌مانند.

چرا مهم است

برای کاربران عادی، این روش می‌تواند به ارائه پاسخ‌های قابل‌اعتمادتر از سوی چت‌بات‌ها، به‌ویژه در پرسش‌های واقع‌محور، کمک کند. همچنین راهی برای علامت‌گذاری پاسخ‌هایی که احتمالاً دچار توهم‌اند، بدون محاسبات پرهزینه، پیشنهاد می‌دهد. بااین‌حال، استفاده از این روش همچنان مستلزم دسترسی به حالت‌های پنهان مدل است؛ چیزی که بیشتر APIهای عمومی در اختیار نمی‌گذارند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.