OossaYapay zekâ hızla gelişiyor. Biz basitçe anlatıyoruz.
Bülten

Kısa haber · 1 dk okuma

Araştırma, üretimde kullanılan bir SQL değerlendiricisinin insanlarla zayıf ölçüde uzlaştığını ortaya koydu

Araştırmacılar, metinden SQL üretimi sürecinde kullanılan bir yapay zekâ değerlendiricisini test etti ve değerlendiricinin insan hakemlerle sık sık farklı sonuçlara vardığını buldu. Makaleye göre, kendi sunucularında çalıştırılan Qwen modeli, çağrı başına maliyetin çok küçük bir bölümü karşılığında çok daha iyi performans gösterdi.

Oossa · Oossa Hakkında

arXiv’de yayımlanan çalışmayı kaleme alan ekip, kullanılan GPT-4o mini değerlendiricisinin, yapay zekânın ürettiği SQL sorgusunun soruyla örtüşüp örtüşmediğini incelerken insan hakemlerle yalnızca zayıf ölçüde uzlaştığını buldu. Çok sayıda anlaşmazlık içerecek şekilde seçilen bir veri kümesinde uyum neredeyse sıfırdı; ayrıca değerlendirici, insanların soruya uygun bulduğu örneklerin yüzde 77,1’ini yanlış biçimde hatalı olarak işaretledi.

Araştırmacılar, kendi sunucularında çalıştırdıkları Qwen3.6-27B modelinin Claude Opus 4.7’ye benzer düzeyde uyum sağladığını ve çağrı başına maliyetinin yaklaşık üç yüzde biri olduğunu belirtiyor. Ancak doğrudan karşılaştırmanın yalnızca 96 örneği kapsadığı uyarısında bulunuyorlar.

Neden önemli

Üretilen SQL sorgularını değerlendirmek için yapay zekâ kullanan ekiplerin, bu değerlendiricilerin kararlarına güvenmeden önce performanslarını insan değerlendirmeleriyle karşılaştırarak ölçmesi gerekebilir.

Bu makale faydalı oldu mu?

Kaynaklar ve referanslar

#KaynakYayınTarihAna fikir
1Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗arXiv28 Eyl 2026arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a

1 kaynak

Son güncelleme:

Oossallms.txt.md

Paylaş

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.

Araştırma, üretimde kullanılan bir SQL değerlendiricisinin insanlarla zayıf ölçüde uzlaştığını ortaya koydu – Oossa