Kısa haber · 1 dk okuma
Araştırma, üretimde kullanılan bir SQL değerlendiricisinin insanlarla zayıf ölçüde uzlaştığını ortaya koydu
Araştırmacılar, metinden SQL üretimi sürecinde kullanılan bir yapay zekâ değerlendiricisini test etti ve değerlendiricinin insan hakemlerle sık sık farklı sonuçlara vardığını buldu. Makaleye göre, kendi sunucularında çalıştırılan Qwen modeli, çağrı başına maliyetin çok küçük bir bölümü karşılığında çok daha iyi performans gösterdi.
Oossa · Oossa Hakkında
arXiv’de yayımlanan çalışmayı kaleme alan ekip, kullanılan GPT-4o mini değerlendiricisinin, yapay zekânın ürettiği SQL sorgusunun soruyla örtüşüp örtüşmediğini incelerken insan hakemlerle yalnızca zayıf ölçüde uzlaştığını buldu. Çok sayıda anlaşmazlık içerecek şekilde seçilen bir veri kümesinde uyum neredeyse sıfırdı; ayrıca değerlendirici, insanların soruya uygun bulduğu örneklerin yüzde 77,1’ini yanlış biçimde hatalı olarak işaretledi.
Araştırmacılar, kendi sunucularında çalıştırdıkları Qwen3.6-27B modelinin Claude Opus 4.7’ye benzer düzeyde uyum sağladığını ve çağrı başına maliyetinin yaklaşık üç yüzde biri olduğunu belirtiyor. Ancak doğrudan karşılaştırmanın yalnızca 96 örneği kapsadığı uyarısında bulunuyorlar.
Neden önemli
Üretilen SQL sorgularını değerlendirmek için yapay zekâ kullanan ekiplerin, bu değerlendiricilerin kararlarına güvenmeden önce performanslarını insan değerlendirmeleriyle karşılaştırarak ölçmesi gerekebilir.
Kaynaklar ve referanslar
| # | Kaynak | Yayın | Tarih | Ana fikir |
|---|---|---|---|---|
| 1 | Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗ | arXiv | 28 Eyl 2026 | arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a |
1 kaynak
Son güncelleme:
Oossa · Bülten
Yapay zekâda hafta, anlaşılır dille
Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.