OossaИИ быстро развивается. Мы объясняем это просто.
Рассылка

Заметка · 1 мин чтения

Исследование выявило низкую согласованность производственного SQL-судьи

Исследователи проверили ИИ-судью, используемого в конвейере преобразования текста в SQL, и обнаружили, что его оценки часто расходятся с мнением проверяющих-людей. По данным статьи, самостоятельно размещённая модель Qwen показала гораздо лучшие результаты при примерно в 300 раз меньшей стоимости одного запроса.

Oossa · О проекте Oossa

Команда исследователей, опубликовавшая работу на arXiv, выяснила, что используемый в их системе судья GPT-4o mini лишь слабо согласовывал свои оценки с мнением проверяющих-людей, когда определял, соответствует ли SQL-запрос, сгенерированный ИИ, исходному вопросу. В выборке, специально составленной так, чтобы в ней было много разногласий, согласованность была близка к нулю; кроме того, судья ошибочно отметил как несоответствующие 77,1% случаев, которые люди сочли корректными.

По словам исследователей, самостоятельно размещённая модель Qwen3.6-27B показала согласованность на уровне Claude Opus 4.7, а каждый её запрос обходился примерно в 300 раз дешевле. Авторы предупреждают, что прямое сравнение охватывало всего 96 примеров.

Почему это важно

Командам, использующим ИИ для оценки сгенерированных SQL-запросов, стоит сначала проверить точность судьи, сравнив его оценки с человеческими, и лишь затем доверять его решениям.

Эта статья была полезной?

Источники и ссылки

#ИсточникИзданиеДатаГлавное
1Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗arXiv28 сент. 2026 г.arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a

1 источников

Обновлено:

Oossallms.txt.md

Поделиться

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.