# Araştırma, üretimde kullanılan bir SQL değerlendiricisinin insanlarla zayıf ölçüde uzlaştığını ortaya koydu

> Araştırmacılar, metinden SQL üretimi sürecinde kullanılan bir yapay zekâ değerlendiricisini test etti ve değerlendiricinin insan hakemlerle sık sık farklı sonuçlara vardığını buldu. Makaleye göre, kendi sunucularında çalıştırılan Qwen modeli, çağrı başına maliyetin çok küçük bir bölümü karşılığında çok daha iyi performans gösterdi.

Oossa · 2026-09-29 · https://oossa.com/tr/study-finds-weak-agreement-from-a-production-sql-judge

arXiv’de yayımlanan çalışmayı kaleme alan ekip, kullanılan GPT-4o mini değerlendiricisinin, yapay zekânın ürettiği SQL sorgusunun soruyla örtüşüp örtüşmediğini incelerken insan hakemlerle yalnızca zayıf ölçüde uzlaştığını buldu. Çok sayıda anlaşmazlık içerecek şekilde seçilen bir veri kümesinde uyum neredeyse sıfırdı; ayrıca değerlendirici, insanların soruya uygun bulduğu örneklerin yüzde 77,1’ini yanlış biçimde hatalı olarak işaretledi.

Araştırmacılar, kendi sunucularında çalıştırdıkları Qwen3.6-27B modelinin Claude Opus 4.7’ye benzer düzeyde uyum sağladığını ve çağrı başına maliyetinin yaklaşık üç yüzde biri olduğunu belirtiyor. Ancak doğrudan karşılaştırmanın yalnızca 96 örneği kapsadığı uyarısında bulunuyorlar.

## Gerçekler

- GPT-4o mini’nin Cohen kappa değeri, anlaşmazlıkların yoğun olduğu örneklemde 0,04, rastgele yapılan kontrol örnekleminde ise 0,42 oldu.
- Qwen3.6-27B’nin kappa değeri 0,72’ye, Claude Opus 4.7’ninki ise 0,71’e ulaştı.

## Neden önemli

Üretilen SQL sorgularını değerlendirmek için yapay zekâ kullanan ekiplerin, bu değerlendiricilerin kararlarına güvenmeden önce performanslarını insan değerlendirmeleriyle karşılaştırarak ölçmesi gerekebilir.

## Kaynaklar ve referanslar

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

Son güncelleme: 2026-09-29
