Ollama 0.35에서 Jev 스타일 의사결정 모델 API를 지원한다. 새 /v1/systemone 엔드포인트를 호출해 텍스트 상태와 이름이 지정된 질문 목록을 보내면, 한 번의 요청으로 구조화된 답변을 받을 수 있다. Nimble 9B, Tev1 4B, Tev1 0.8B 등 3개 모델을 바로 사용할 수 있다.
로컬에서 실행하면 네트워크 지연이 사라진다. M5 Max MacBook에서 Nimble 9B는 의사결정 한 건당 평균 91ms가 걸린다. 모델은 curl 또는 TypeSafe의 Python SDK로 사용할 수 있다.
왜 중요한가
로컬 의사결정 모델을 사용하면 티켓 분류나 콘텐츠 검토 같은 작업을 빠르고 저렴하게 처리할 수 있다.