# Une étude révèle un faible accord d’un évaluateur SQL utilisé en production

> Des chercheurs ont évalué un juge IA intégré à un système de conversion du texte en SQL et constaté qu’il était souvent en désaccord avec les évaluateurs humains. Selon l’étude, un modèle Qwen hébergé en interne a obtenu de bien meilleurs résultats pour un coût par appel bien moindre.

Oossa · 2026-09-29 · https://oossa.com/fr/study-finds-weak-agreement-from-a-production-sql-judge

Une équipe qui a publié ses résultats sur arXiv a constaté que le juge GPT-4o mini qu’elle avait déployé ne s’accordait que faiblement avec les évaluateurs humains lorsqu’il s’agissait de vérifier si le SQL généré par une IA correspondait à une question. Dans un échantillon constitué pour inclure de nombreux désaccords, le taux d’accord était proche de zéro ; le juge a également signalé à tort comme non conformes 77,1 % des cas que les humains estimaient fidèles à la question.

Les chercheurs indiquent qu’un modèle Qwen3.6-27B hébergé en interne a atteint un niveau d’accord comparable à celui de Claude Opus 4.7, pour un coût par appel environ 300 fois inférieur. Ils précisent toutefois que la comparaison directe ne portait que sur 96 exemples.

## Les faits

- Le kappa de Cohen de GPT-4o mini était de 0,04 sur un échantillon enrichi en désaccords et de 0,42 lors d’une vérification ponctuelle aléatoire.
- Qwen3.6-27B a atteint un kappa de 0,72 ; Claude Opus 4.7, de 0,71.

## Pourquoi c'est important

Les équipes qui utilisent l’IA pour évaluer du SQL généré pourraient devoir mesurer la précision de leur juge en la comparant à des évaluations humaines avant de se fier à ses décisions.

## Sources et références

1. [Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline](https://arxiv.org/abs/2609.30290) – arXiv, 2026-09-28

Dernière mise à jour: 2026-09-29
