NVIDIA, 실시간 다중 화자 식별 모델 'Nemotron 3 Diarization' 공개
음성 에이전트 개발 시 화자 분리 정확도 개선 및 오버랩 음성 처리 성능 강화.
요약
NVIDIA는 화자 분할 기술을 통해 누가 언제 발언했는지 파악하고, 발언 내용과 화자를 정확히 연결하는 NVIDIA Nemotron 3 Diarization 모델을 공개했다. 이 모델은 1억 개의 파라미터를 가진 오픈 웨이트 모델로, Voice Arena의 Diarization-Bench 리더보드에서 14.72%의 Diarization Error Rate(DER)를 기록하며 1위를 차지했다. 실시간 및 녹음된 대화에서 최대 8명의 화자를 지원하며, 중첩된 음성 처리와 유연한 청크 단위 처리, 맞춤형 스트리밍 지연 시간 설정이 가능하다. 기존 NVIDIA Streaming Sortformer 모델이 4명의 화자 분할에 최적화되었던 것에 비해, 이번 모델은 더 많은 화자를 지원하고 성능을 개선했다. 화자 분할 기술은 회의, 고객 상담, 팟캐스트 등의 전사 과정에서 누가 발언했는지 명확히 구분함으로써 검색, 요약, 행동 항목 추출 등 대화 분석의 정확도를 크게 향상시킨다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 **Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization**
원문 보기 ↗