NVIDIA представила открытую модель, способную распознавать, кто именно говорит и в какой момент времени.

28 Сентября 2026 года


NVIDIA представила Nemotron 3 Diarization — компактную модель для распознавания говорящих в аудиопотоке.

Всего около 100 миллионов параметров, и она уверенно справляется как с прямыми эфирами, так и с готовыми записями. Модель различает до восьми участников диалога и не теряет нить даже тогда, когда несколько голосов звучат одновременно.

Веса и инструкции по запуску Nemotron 3 Diarization опубликованы на Hugging Face по лицензии OpenMDW 1.1, и модель допускается использовать как в коммерческих, так и в некоммерческих проектах

Яндекс цитирования