# Исследование выявило низкую согласованность производственного SQL-судьи

> Исследователи проверили ИИ-судью, используемого в конвейере преобразования текста в SQL, и обнаружили, что его оценки часто расходятся с мнением проверяющих-людей. По данным статьи, самостоятельно размещённая модель Qwen показала гораздо лучшие результаты при примерно в 300 раз меньшей стоимости одного запроса.

Oossa · 2026-09-29 · https://oossa.com/ru/study-finds-weak-agreement-from-a-production-sql-judge

Команда исследователей, опубликовавшая работу на arXiv, выяснила, что используемый в их системе судья GPT-4o mini лишь слабо согласовывал свои оценки с мнением проверяющих-людей, когда определял, соответствует ли SQL-запрос, сгенерированный ИИ, исходному вопросу. В выборке, специально составленной так, чтобы в ней было много разногласий, согласованность была близка к нулю; кроме того, судья ошибочно отметил как несоответствующие 77,1% случаев, которые люди сочли корректными.

По словам исследователей, самостоятельно размещённая модель Qwen3.6-27B показала согласованность на уровне Claude Opus 4.7, а каждый её запрос обходился примерно в 300 раз дешевле. Авторы предупреждают, что прямое сравнение охватывало всего 96 примеров.

## Факты

- Коэффициент каппа Коэна для GPT-4o mini составил 0,04 на выборке, обогащённой примерами с разногласиями, и 0,42 при случайной выборочной проверке.
- Модель Qwen3.6-27B показала каппу 0,72, а Claude Opus 4.7 — 0,71.

## Почему это важно

Командам, использующим ИИ для оценки сгенерированных SQL-запросов, стоит сначала проверить точность судьи, сравнив его оценки с человеческими, и лишь затем доверять его решениям.

## Источники и ссылки

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

Обновлено: 2026-09-29
