Oossa

Transformers 5.18.0 bringt Streaming-Modell zur Sprechererkennung

Das neue Release von Hugging Face enthält Nemotron 3 Diarization. Das Streaming-Modell kann in Live-Audio bis zu acht Sprecher kennzeichnen.

KurzmeldungOossaVon Oossa veröffentlicht: 1 Min. Lesezeit

Hugging Face hat Transformers v5.18.0 veröffentlicht. Das Update enthält Nemotron 3 Diarization, ein Modell mit offenen Gewichten, das in Echtzeit oder in Audioaufnahmen erkennt, „wer wann gesprochen hat“. Es unterstützt bis zu acht Sprecher. Entwickler können die Latenz zwischen 80 ms und 30.4 Sekunden einstellen.

Das Release umfasst außerdem die multimodalen Modelle NemotronH Omni und HyperCLOVAX Vision V2 sowie zahlreiche Fehlerbehebungen und Leistungsverbesserungen.

Warum es wichtig ist

Entwickler können ihren Apps jetzt Live-Transkriptionen mit Sprecherkennzeichnung hinzufügen, damit sich Meetings und Podcasts leichter verfolgen lassen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.