Aleph Alpha, sunulan belgede gerekli bilgi yoksa bir dil modeline yanıt vermeyi reddetmeyi öğreten bir yöntem yayımladı. Merlin‑Arthur protokolü adı verilen teknik, modeli (Arthur) iki yardımcıyla karşı karşıya getiriyor: Eksiksiz bir pasaj sunan Merlin ve belirleyici cümleyi çıkaran Morgana. Eğitim sırasında Arthur hangi tarafla karşı karşıya olduğunu hiçbir zaman bilmiyor; böylece yalnızca kanıt bulunduğunda yanıt vermeyi, aksi durumda ise yanıt vermekten kaçınmayı öğreniyor. Beş soru-cevap kıyaslamasında yapılan testler, yanlış yanıtların 35 yüzde puana kadar azaldığını, yeni bir “temellendirme puanının” ise 0,38’e kadar yükseldiğini gösteriyor.
Neden önemli
Bu yöntem, kullanıcıların bir yapay zekâ yanıtının gerçekten kendi belgelerindeki bilgilere dayanıp dayanmadığını anlamasını sağlayarak riskli halüsinasyonları azaltıyor.