# Jev 모델, 체스 봇 불릿 레이팅 2200 돌파와 라벨링 효율 향상

> 확률만 출력하는 Jev를 저비용 평가기로 증류해 Stockfish 봇의 Lichess 불릿 레이팅을 2200 이상으로 끌어올렸다. Qwen3‑32B와 라벨링을 분담하면 효율도 높아진다.

Oossa · 2026-10-08 · https://oossa.com/ko/jev-model-helps-chess-bot-break-2200-bullet-rating-and-improves-label-efficiency

TypeSafe 연구진은 보정된 확률만 반환하는 모델 Jev를 공개했다. Jev의 판단을 Stockfish의 탐색에 적용하고 이를 빠른 평가기로 증류한 결과, 봇은 Lichess에서 불릿 레이팅 2200을 기록했다. 라벨링 예산을 Jev와 대규모 언어 모델 Qwen3‑32B에 나눠 배정하면 Qwen만 사용하는 경우보다 두 모델을 함께 활용한 라벨이 약 9.6 Elo 더 높은 성능을 보였으며, 새로운 오프닝에서도 같은 효과가 나타났다.

## 팩트

- Jev를 적용한 Stockfish가 Lichess 불릿 레이팅 2200을 넘어섰다.
- Jev와 Qwen3‑32B의 라벨을 평균한 방식은 Qwen만 사용한 라벨링보다 9.6 Elo 높았다(95% 구간 4.3–14.9).

## 왜 중요한가

체스 개발자는 값비싼 LLM 호출을 줄이면서 더 강한 봇을 만들 수 있어 연산 및 라벨링 비용을 절감할 수 있다.

## 출처 및 참고 자료

1. [From Probabilities to Decisions: Search and Multi-Teacher Distillation with Jev](https://arxiv.org/abs/2610.09188) – arXiv, 2026-10-08
2. [Emo-Jev: Probabilistic Reasoning for Emotion Classification with Jev](https://arxiv.org/abs/2610.08829) – arXiv, 2026-10-08
3. [JevForest: Path Voting for Budgeted Feature Acquisition](https://arxiv.org/abs/2610.10615) – arXiv stat.ML, 2026-10-09
4. [Can a System-One LLM Perform Knowledge Tracing When Few or No Learners Are Logged?](https://arxiv.org/abs/2610.11135) – arXiv, 2026-10-09

최종 업데이트: 2026-10-09
