Nvidia бесплатно выпустила модель, которая различает до восьми голосов в разговоре
Nvidia представила небольшую нейросеть Nemotron 3 Diarization — она определяет, кто из участников разговора говорит в конкретный момент. Это может пригодиться бизнесу, который расшифровывает звонки, совещания или встречи с клиентами.
27 сентября 2026, 17:10 0 комментариев
Что произошло. Nvidia выпустила модель Nemotron 3 Diarization — программу, которая в аудиозаписи или в живом разговоре определяет, кто из людей говорит в каждый момент. Модель небольшая (около 100 миллионов параметров, то есть она не требует мощного оборудования), и её код доступен бесплатно. Она умеет различать до восьми разных голосов и замечает, когда несколько человек говорят одновременно. Если участников много, есть шум или эхо, модель чаще ошибается. Работает как с готовыми записями, так и с прямым звуком в реальном времени.
Если объединить эту модель с системой распознавания речи (например, Parakeet), можно получить текстовую расшифровку разговора с пометками, кто что сказал — правда, участники будут обозначены обезличенно, вроде «говорящий 2», без имён. По данным теста Diarization-Bench, модель сейчас показывает лучший результат среди подобных систем и заметно точнее своей предыдущей версии.
Что это значит для бизнеса. Для小 и среднего бизнеса это может упростить расшифровку звонков с клиентами, совещаний или переговоров: программа сама разделит, где говорит менеджер, а где клиент. Это удобно для контроля качества обслуживания или анализа продаж. Но важно понимать: модель не называет людей по именам, а работает с обезличенными метками, и для полноценной расшифровки текста её нужно совмещать с отдельной программой распознавания речи. Также точность падает при шуме, эхе или большом числе участников.
Подготовлено с помощью ИИ по материалам the-decoder.com
Обсуждение
0 комментариевКомментариев пока нет. Будьте первым, кто поделится мнением.
Обсуждать новости могут только зарегистрированные пользователи. Войти или зарегистрируйтесь.