Ollama 0.35が、Jev風の判断モデルAPIに対応した。新しい「/v1/systemone」エンドポイントにテキスト形式の状態と名前付きの質問セットを送ると、1回のリクエストで構造化された回答を得られる。利用できるモデルは、Nimble 9B、Tev1 4B、Tev1 0.8Bの3つ。
ローカルで実行すればネットワーク遅延をなくせる。M5 Max搭載MacBookでは、Nimble 9Bの判断1回あたりの平均処理時間は91ミリ秒。モデルはcurlまたはTypeSafeのPython SDKで利用できる。
なぜ重要か
ローカル判断モデルを使えば、チケットの振り分けやコンテンツモデレーションなどの分類を、低コストかつ即座に実行できる。