Brève · 1 min de lecture
Une étude révèle un faible accord d’un évaluateur SQL utilisé en production
Des chercheurs ont évalué un juge IA intégré à un système de conversion du texte en SQL et constaté qu’il était souvent en désaccord avec les évaluateurs humains. Selon l’étude, un modèle Qwen hébergé en interne a obtenu de bien meilleurs résultats pour un coût par appel bien moindre.
Oossa · À propos d’Oossa
Une équipe qui a publié ses résultats sur arXiv a constaté que le juge GPT-4o mini qu’elle avait déployé ne s’accordait que faiblement avec les évaluateurs humains lorsqu’il s’agissait de vérifier si le SQL généré par une IA correspondait à une question. Dans un échantillon constitué pour inclure de nombreux désaccords, le taux d’accord était proche de zéro ; le juge a également signalé à tort comme non conformes 77,1 % des cas que les humains estimaient fidèles à la question.
Les chercheurs indiquent qu’un modèle Qwen3.6-27B hébergé en interne a atteint un niveau d’accord comparable à celui de Claude Opus 4.7, pour un coût par appel environ 300 fois inférieur. Ils précisent toutefois que la comparaison directe ne portait que sur 96 exemples.
Pourquoi c'est important
Les équipes qui utilisent l’IA pour évaluer du SQL généré pourraient devoir mesurer la précision de leur juge en la comparant à des évaluations humaines avant de se fier à ses décisions.
Sources et références
| # | Source | Média | Date | À retenir |
|---|---|---|---|---|
| 1 | Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline ↗ | arXiv | 28 sept. 2026 | arXiv:2609.30290v1 Announce Type: new Abstract: Production text-to-SQL pipelines often end with an LLM-as-judge whose agreement with human a |
1 sources
Dernière mise à jour:
Oossa · Newsletter
La semaine de l'IA, expliquée
Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.