중요Reddit
GigaChat3.1-Audio 10B 공개: 오디오 네이티브 MoE 모델
긴 오디오의 타임스탬프 이벤트 추출·요약이 핵심. 통화·회의 음성 분석 파이프라인에 검토 가치.
요약
GigaChat3.1-Audio-10B-A1.8B는 GigaChat 3.1 Lightning 텍스트 모델을 기반으로 개발된 오디오 네이티브 LLM으로, Conformer 음성 인코더와 모달리티 어댑터를 통해 음성 임베딩을 Mixture-of-Experts 디코더에 직접 전달한다. 해당 모델은 기존 텍스트 모델의 품질을 유지하면서도 뛰어난 음성 이해 능력을 갖춘 것이 특징이다. 주요 기능으로는 오디오 질의응답 및 분류, 타임스탬프를 포함한 오디오 요약, 이벤트 로컬라이제이션, 도구 사용, 텍스트 전용 작업 수행 등이 있다. 특히 장시간 오디오 내 특정 위치를 파악하는 템포럴 그라운딩(temporal grounding) 성능을 강화하기 위해 TimeGround-1M 데이터셋으로 학습되었다. 상세한 기술 정보는 arXiv 논문을 통해 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 ai-sage/GigaChat3.1-Audio-10B-A1.8B · Hugging Face
원문 보기 ↗