Araştırmacılar, büyük dil modellerinin bir yanıtın doğru olup olmadığına dair geometrik bir ipucu sakladığını keşfetti. Yanlış yanıtlardan doğru yanıtlara geçerken gizil durumlarda görülen ortalama değişimi inceleyerek, hiçbir ince ayar yapmadan aday yanıtları sıralayan bir puanlama vektörü oluşturabiliyorlar. 1 milyar ila 8 milyar parametreli beş modelde test edilen yöntem, ARC‑Challenge ve MMLU'da yaygın sıfır örnekli log-olasılık yaklaşımını 32 puana kadar, TruthfulQA'da ise 52 puana kadar geride bırakıyor.
Yöntem nasıl işliyor?
Araştırmacılar etiketlenmiş elli örneği modele veriyor, ağın yaklaşık orta noktasındaki gizil temsilleri topluyor ve yanlış yanıt durumlarından doğru yanıt durumlarına uzanan ortalama vektörü hesaplıyor. Çıkarım sırasında her yanıt adayı için bu vektörle tek bir ileri geçiş ve bir iç çarpım yeterli oluyor. Yanıt metni üretilmiyor ve model parametrelerinde değişiklik yapılmıyor.
Model güvenilirliği açısından anlamı
Halüsinasyon tespit aracı olarak kullanıldığında geometrik yön, standart olasılık puanlamasının 0.578 değerine karşılık 0.693 AUROC değerine ulaşıyor. Çalışma ayrıca olgusal akıl yürütme, alan bilgisi ve doğrulukla ilgili ipuçlarının birbirine neredeyse dik alt uzaylarda bulunduğunu gösteriyor; başka bir deyişle modeller, farklı doğruluk türleri için ayrı sinyaller saklıyor. Bu durum, modellerin doğru yanıtı çoğu zaman kendi içinde bilmesine rağmen neden bunu çıktı olarak veremediğini açıklayabilir.
Neden önemli
Gündelik kullanıcılar için bu teknik, özellikle olgusal sorularda sohbet botlarının daha güvenilir yanıtlar vermesini sağlayabilir. Ayrıca yüksek hesaplama maliyeti olmadan olası halüsinasyonları işaretlemenin bir yolunu sunuyor. Ancak yöntem, çoğu herkese açık API'nin erişime açmadığı gizil model durumlarına erişim gerektiriyor.