Oossa

Transformers 5.18.0 voegt streamingmodel voor sprekerherkenning toe

De nieuwe release van Hugging Face bevat Nemotron 3 Diarization, een streamingmodel dat in live audio maximaal acht sprekers kan onderscheiden.

Kort berichtOossaGepubliceerd door Oossa: 1 min lezen

Hugging Face heeft Transformers v5.18.0 uitgebracht. De update voegt Nemotron 3 Diarization toe, een model met open gewichten dat in realtime of in audio-opnamen kan bepalen wie wanneer spreekt. Het ondersteunt maximaal acht sprekers en ontwikkelaars kunnen de latentie instellen op 80 ms tot 30,4 seconden.

De release bevat ook de multimodale modellen NemotronH Omni en HyperCLOVAX Vision V2, plus diverse bugfixes en prestatieverbeteringen.

Waarom het ertoe doet

Ontwikkelaars kunnen nu live transcripties met sprekerlabels aan apps toevoegen, zodat vergaderingen en podcasts makkelijker te volgen zijn.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.