پژوهشگران دریافتهاند که مدلهای زبانی بزرگ نشانهای هندسی برای تشخیص درستی پاسخها در خود دارند. با بررسی میانگین تغییر حالتهای پنهان از پاسخهای نادرست به درست، میتوان برداری برای امتیازدهی ساخت که بدون هیچ تنظیم دقیق، پاسخهای پیشنهادی را رتبهبندی کند. این روش که روی پنج مدل با ۱ تا ۸ میلیارد پارامتر آزمایش شده، در ARC‑Challenge و MMLU تا ۳۲ واحد و در TruthfulQA تا ۵۲ واحد بهتر از روش معمولِ احتمال لگاریتمیِ بدون نمونهبرداری عمل میکند.
روش کار
پژوهشگران ۵۰ نمونه برچسبگذاریشده را وارد مدل میکنند، بازنماییهای پنهان را در لایهای حدوداً میانی از شبکه جمعآوری میکنند و بردار میانگینی را محاسبه میکنند که از حالتهای مربوط به پاسخ نادرست به حالتهای پاسخ درست اشاره دارد. هنگام اجرا، هر پاسخ پیشنهادی تنها به یک بار عبور از مدل و یک ضرب داخلی با این بردار نیاز دارد. متنی بهعنوان پاسخ تولید نمیشود و هیچیک از پارامترهای مدل تغییر نمیکند.
پیامدها برای اعتمادپذیری مدل
این جهت هندسی، وقتی بهعنوان آشکارساز توهم به کار میرود، به AUROC برابر با ۰٫۶۹۳ میرسد؛ درحالیکه این رقم برای امتیازدهی معمول بر پایه احتمال ۰٫۵۷۸ است. این پژوهش همچنین نشان میدهد نشانههای درستی در استدلال واقعمحور، دانش حوزهای و راستگویی، در زیرفضاهایی تقریباً متعامد قرار دارند؛ یعنی مدلها برای انواع مختلف درستی، سیگنالهای جداگانهای حفظ میکنند. این یافته شاید توضیح دهد چرا مدلها اغلب پاسخ درست را درونی میدانند، اما در ارائه آن ناکام میمانند.
چرا مهم است
برای کاربران عادی، این روش میتواند به ارائه پاسخهای قابلاعتمادتر از سوی چتباتها، بهویژه در پرسشهای واقعمحور، کمک کند. همچنین راهی برای علامتگذاری پاسخهایی که احتمالاً دچار توهماند، بدون محاسبات پرهزینه، پیشنهاد میدهد. بااینحال، استفاده از این روش همچنان مستلزم دسترسی به حالتهای پنهان مدل است؛ چیزی که بیشتر APIهای عمومی در اختیار نمیگذارند.