참고AI타임스
바이트댄스, 전이중 멀티모달 LLM 'SeedRealtime' 출시
음성·영상·텍스트 동시 처리로 실시간 상호작용 구현. 능동적 에이전트 설계 시 참고할 만한 아키텍처 사례.
요약
바이트댄스가 음성, 영상, 텍스트를 하나의 모델에서 동시에 처리하는 전이중(Full-Duplex) 멀티모달 대형언어모델(LLM) 'SeedRealtime'을 출시했다. 'SeedRealtime'은 통합 아키텍처를 기반으로 주변 환경을 실시간으로 이해하고 능동적으로 소통할 수 있는 것이 핵심이다. 기존의 순차적 음성 처리 방식과 달리, 'SeedRealtime'은 사용자의 질문과 답변을 끊김 없이 주고받는 자연스러운 상호작용을 지원한다. 이를 통해 AI가 보고, 듣고, 말하는 복합적인 멀티모달 기능을 한층 강화했다는 평가를 받는다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 바이트댄스, 전이중 AI '시드리얼타임' 출시..."실시간 멀티모달 모델"
원문 보기 ↗