Ollama 0.35 supporta ora l’API per modelli decisionali in stile Jev. Gli utenti possono chiamare il nuovo endpoint /v1/systemone, inviare uno stato testuale e un insieme di domande con nome e ricevere risposte strutturate con un’unica richiesta. Sono subito disponibili tre modelli: Nimble 9B, Tev1 4B e Tev1 0.8B.
L’esecuzione in locale elimina la latenza di rete: su un MacBook M5 Max, Nimble 9B impiega in media 91 ms per decisione. I modelli sono compatibili con curl o con l’SDK Python di TypeSafe.
Perché conta
I modelli decisionali locali offrono classificazioni istantanee e a basso costo per attività come l’instradamento dei ticket o la moderazione dei contenuti.