Oossa

التقييم الهندسي يعزّز دقة إجابات نماذج اللغة

تكشف طريقة جديدة عن اتجاه في الحالات المخفية للنموذج، يرفع ترتيب الإجابات بما يصل إلى 52 نقطة مقارنة بالتقييم المعتاد القائم على الاحتمالات.

بقلم نشرته Oossa: 1 دقائق قراءة

Domenico Loia · Unsplash

اكتشف باحثون أن نماذج اللغة الكبيرة تخزّن مؤشراً هندسياً يدل على صحة الإجابة. فمن خلال قياس متوسط التغيّر في الحالات المخفية بين الإجابات الخاطئة والصحيحة، يمكنهم إنشاء متجه للتقييم يرتّب الإجابات المرشحة من دون أي ضبط دقيق للنموذج. وعند اختبار التقنية على خمسة نماذج تتراوح أحجامها بين 1 billion و8 billion من المعلمات، تفوقت على النهج المعتاد الذي يعتمد على لوغاريتم الاحتمال من دون أمثلة، بما يصل إلى 32 نقطة في ARC‑Challenge وMMLU، وإلى 52 نقطة في TruthfulQA.

آلية عمل الطريقة

استخدم الباحثون خمسين مثالاً موسوماً، وأدخلوها إلى النموذج لجمع تمثيلات مخفية من نقطة تقع تقريباً في منتصف الشبكة، ثم حسبوا متجه المتوسط الذي يشير من حالات الإجابات الخاطئة إلى حالات الإجابات الصحيحة. وعند الاستدلال، لا يحتاج كل جواب مرشح إلا إلى تمريرة أمامية واحدة وحاصل ضرب نقطي واحد مع هذا المتجه. ولا يُنشأ أي نص للإجابة، ولا تُعدّل أي من معلمات النموذج.

ما تعنيه لموثوقية النماذج

عند استخدام الاتجاه الهندسي لكشف الهلوسة، يبلغ مقياس AUROC فيه 0.693، مقارنةً بـ0.578 للتقييم المعتاد القائم على الاحتمالات. وتُظهر الدراسة أيضاً أن مؤشرات صحة الاستدلال الواقعي والمعرفة التخصصية والصدق تقع في فضاءات فرعية متعامدة تقريباً، ما يعني أن النماذج تحتفظ بإشارات منفصلة لأنواع مختلفة من الصحة. وقد يفسر ذلك سبب معرفة النماذج للإجابة الصحيحة داخلياً في كثير من الأحيان، مع إخفاقها في تقديمها.

لماذا يهم

بالنسبة إلى المستخدمين العاديين، قد تسهم هذه التقنية في جعل إجابات روبوتات الدردشة أكثر موثوقية، ولا سيما في الأسئلة الواقعية. كما أنها تشير إلى طريقة لرصد الإجابات المرجح أن تنطوي على هلوسة من دون حسابات مكلفة. لكن استخدامها لا يزال يتطلب الوصول إلى الحالات المخفية للنموذج، وهي بيانات لا تتيحها معظم واجهات البرمجة العامة.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.