# Geometrik puanlama dil modellerinde doğru yanıtları öne çıkarıyor

> Yeni bir yöntem, modelin gizil durumlarında standart olasılık puanlamasına kıyasla yanıtları 52 puana kadar daha iyi sıralayan bir yön buluyor.

Oossa · 2026-10-06 · https://oossa.com/tr/geometric-scoring-boosts-answer-correctness-in-language-models

Araştırmacılar, büyük dil modellerinin bir yanıtın doğru olup olmadığına dair geometrik bir ipucu sakladığını keşfetti. Yanlış yanıtlardan doğru yanıtlara geçerken gizil durumlarda görülen ortalama değişimi inceleyerek, hiçbir ince ayar yapmadan aday yanıtları sıralayan bir puanlama vektörü oluşturabiliyorlar. 1 milyar ila 8 milyar parametreli beş modelde test edilen yöntem, ARC‑Challenge ve MMLU'da yaygın sıfır örnekli log-olasılık yaklaşımını 32 puana kadar, TruthfulQA'da ise 52 puana kadar geride bırakıyor.

## Yöntem nasıl işliyor?

Araştırmacılar etiketlenmiş elli örneği modele veriyor, ağın yaklaşık orta noktasındaki gizil temsilleri topluyor ve yanlış yanıt durumlarından doğru yanıt durumlarına uzanan ortalama vektörü hesaplıyor. Çıkarım sırasında her yanıt adayı için bu vektörle tek bir ileri geçiş ve bir iç çarpım yeterli oluyor. Yanıt metni üretilmiyor ve model parametrelerinde değişiklik yapılmıyor.

## Model güvenilirliği açısından anlamı

Halüsinasyon tespit aracı olarak kullanıldığında geometrik yön, standart olasılık puanlamasının 0.578 değerine karşılık 0.693 AUROC değerine ulaşıyor. Çalışma ayrıca olgusal akıl yürütme, alan bilgisi ve doğrulukla ilgili ipuçlarının birbirine neredeyse dik alt uzaylarda bulunduğunu gösteriyor; başka bir deyişle modeller, farklı doğruluk türleri için ayrı sinyaller saklıyor. Bu durum, modellerin doğru yanıtı çoğu zaman kendi içinde bilmesine rağmen neden bunu çıktı olarak veremediğini açıklayabilir.

## Gerçekler

- Yöntem, sıfır örnekli puanlamayı ARC‑Challenge ve MMLU'da +32.0 yüzde puana kadar iyileştiriyor.
- TruthfulQA'da kazanım +38.1 ile +51.8 yüzde puan arasında değişiyor.
- Llama, Qwen ve Gemma olmak üzere üç aileden, 1 B ile 8 B parametre aralığında beş model test edildi.
- Yalnızca etiketlenmiş elli örnek gerekiyor; parametre güncellemesi yapılmıyor.
- Halüsinasyon tespit aracı olarak yöntem, log-olasılık puanlamasındaki 0.578'e karşılık 0.693 AUROC değerine ulaşıyor.

## Neden önemli

Gündelik kullanıcılar için bu teknik, özellikle olgusal sorularda sohbet botlarının daha güvenilir yanıtlar vermesini sağlayabilir. Ayrıca yüksek hesaplama maliyeti olmadan olası halüsinasyonları işaretlemenin bir yolunu sunuyor. Ancak yöntem, çoğu herkese açık API'nin erişime açmadığı gizil model durumlarına erişim gerektiriyor.

## Kaynaklar ve referanslar

1. [Correctness Is a Direction: Geometric Answer Selection in Language Models](https://arxiv.org/abs/2610.04512) – arXiv, 2026-10-06

Son güncelleme: 2026-10-06
