# Transformers 5.18.0 新增流式说话人分离模型

> Hugging Face 发布新版本，加入 Nemotron 3 Diarization，可为实时音频中的最多八位说话人标注身份。

Oossa · 2026-09-30 · https://oossa.com/zh/transformers-5-18-0-adds-streaming-speaker-diarization-model

借助 AI 编写和翻译。请核对下方原始来源。

Hugging Face 发布了 Transformers v5.18.0。此次更新加入 Nemotron 3 Diarization，这是一款开放权重模型，可识别实时或离线音频中“谁在何时说话”。它最多支持八位说话人，开发者还可以选择 80 ms 至 30.4 秒的延迟。

此次发布还加入了多模态模型 NemotronH Omni 和 HyperCLOVAX Vision V2，并修复了一系列问题、优化了性能。

## 事实

- 5.18.0 版本于 2026-09-30 发布
- Nemotron 3 Diarization 最多支持 8 位说话人，延迟范围为 80 ms 至 30.4 s

## 为什么重要

开发者现在可以在应用中加入实时说话人标注转录，让会议和播客更容易听懂。

## 来源与参考

1. [huggingface/transformers Release 5.18.0](https://github.com/huggingface/transformers/releases/tag/v5.18.0) – Transformers, 2026-09-30

最后更新: 2026-09-30
