← promppy_ 실시간 AI 뉴스
중요Reddit

GigaChat3.1-Audio 10B 공개: 오디오 네이티브 MoE 모델

긴 오디오의 타임스탬프 이벤트 추출·요약이 핵심. 통화·회의 음성 분석 파이프라인에 검토 가치.

요약

GigaChat3.1-Audio-10B-A1.8B는 GigaChat 3.1 Lightning 텍스트 모델을 기반으로 개발된 오디오 네이티브 LLM으로, Conformer 음성 인코더와 모달리티 어댑터를 통해 음성 임베딩을 Mixture-of-Experts 디코더에 직접 전달한다. 해당 모델은 기존 텍스트 모델의 품질을 유지하면서도 뛰어난 음성 이해 능력을 갖춘 것이 특징이다. 주요 기능으로는 오디오 질의응답 및 분류, 타임스탬프를 포함한 오디오 요약, 이벤트 로컬라이제이션, 도구 사용, 텍스트 전용 작업 수행 등이 있다. 특히 장시간 오디오 내 특정 위치를 파악하는 템포럴 그라운딩(temporal grounding) 성능을 강화하기 위해 TimeGround-1M 데이터셋으로 학습되었다. 상세한 기술 정보는 arXiv 논문을 통해 확인할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 ai-sage/GigaChat3.1-Audio-10B-A1.8B · Hugging Face

원문 보기 ↗
다음 뉴스 →

중요소식통: OpenAI·Anthropic, 오픈소스 AI 규제 위해 워싱턴에 조용히 로비

규제화 시 로컬·오픈소스 모델 도입 전략 재검토 필요. 폐쇄 API 의존도 심화 가능성 주시.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스