Заметка · 1 мин чтения
Исследование выявило низкую согласованность производственного SQL-судьи
Исследователи проверили ИИ-судью, используемого в конвейере преобразования текста в SQL, и обнаружили, что его оценки часто расходятся с мнением проверяющих-людей. По данным статьи, самостоятельно размещённая модель Qwen показала гораздо лучшие результаты при примерно в 300 раз меньшей стоимости одного запроса.
Oossa · О проекте Oossa
Команда исследователей, опубликовавшая работу на arXiv, выяснила, что используемый в их системе судья GPT-4o mini лишь слабо согласовывал свои оценки с мнением проверяющих-людей, когда определял, соответствует ли SQL-запрос, сгенерированный ИИ, исходному вопросу. В выборке, специально составленной так, чтобы в ней было много разногласий, согласованность была близка к нулю; кроме того, судья ошибочно отметил как несоответствующие 77,1% случаев, которые люди сочли корректными.
По словам исследователей, самостоятельно размещённая модель Qwen3.6-27B показала согласованность на уровне Claude Opus 4.7, а каждый её запрос обходился примерно в 300 раз дешевле. Авторы предупреждают, что прямое сравнение охватывало всего 96 примеров.
Почему это важно
Командам, использующим ИИ для оценки сгенерированных SQL-запросов, стоит сначала проверить точность судьи, сравнив его оценки с человеческими, и лишь затем доверять его решениям.
Источники и ссылки
| # | Источник | Издание | Дата | Главное |
|---|---|---|---|---|
| 1 | Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗ | arXiv | 28 сент. 2026 г. | arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a |
1 источников
Обновлено:
Oossa · Рассылка
Неделя ИИ — простыми словами
Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.