참고팁X
AI 음성 인식 기술 스타트업, 주요 모델 대비 화자 식별 성능 우위 확보
화자 분리 및 중첩 음성 복원 등 구체적인 기술 파이프라인을 제시, 음성 AI 파이프라인 설계 시 참고할 만한 방법론.
요약
최근 한 스타트업이 OpenAI, ElevenLabs, Deepgram, AssemblyAI 등 주요 AI 음성 기술 기업들을 제치고 화자 분리(Speaker Diarization) 성능 테스트에서 1위를 차지했다. 이들은 사무실 회의, 소음이 있는 회의, 실제 저녁 모임 등 다양한 환경에서 기존 상용 시스템보다 낮은 오류율을 기록했으며, 전체 성능에서 2위 시스템보다 7.6점 높은 점수를 획득했다. 해당 기술은 화자를 식별한 뒤 중첩된 음성을 복구하고, 각 인물의 음성을 별도로 전사한 후 깨끗한 음성 샘플을 통해 인물을 인식하는 방식으로 구현되었다. 특히 AI 회의록 작성 및 앰비언트 어시스턴트의 핵심 기능인 화자 식별 정확도에서 뛰어난 성과를 보였다. 또한, 이 스타트업은 기존 대비 10분의 1 수준의 비용으로 동일한 작업을 수행할 수 있다고 밝혔다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @DataChaz: A STARTUP JUST BEAT FOUR BIG NAMES IN AI SPEECH ON WHO SAID WHAT OpenAI. ElevenLabs. Deepgram. AssemblyAI. The task: identifying s
원문 보기 ↗