TypeSafe 연구진은 보정된 확률만 반환하는 모델 Jev를 공개했다. Jev의 판단을 Stockfish의 탐색에 적용하고 이를 빠른 평가기로 증류한 결과, 봇은 Lichess에서 불릿 레이팅 2200을 기록했다. 라벨링 예산을 Jev와 대규모 언어 모델 Qwen3‑32B에 나눠 배정하면 Qwen만 사용하는 경우보다 두 모델을 함께 활용한 라벨이 약 9.6 Elo 더 높은 성능을 보였으며, 새로운 오프닝에서도 같은 효과가 나타났다.
왜 중요한가
체스 개발자는 값비싼 LLM 호출을 줄이면서 더 강한 봇을 만들 수 있어 연산 및 라벨링 비용을 절감할 수 있다.