모티프, MoE 모델 'Motif-3' 아키텍처 상세 공개: GDLA 및 Polynorm 적용
MoE 모델의 핵심 아키텍처 정보(GDLA, Polynorm) 공개. 오픈소스 LLM 아키텍처 연구 시 참고할 가치가 있음.
요약
한국 AI 기업 motif가 13B 활성 파라미터, 총 314B 파라미터 규모의 MoE(Mixture-of-Experts) 모델을 오픈 웨이트로 공개했다. 해당 모델은 Minimax M3나 DeepSeek V4 Pro와 같은 대형 모델과 동등한 수준의 성능을 보여주는 것으로 평가받는다. 모델 구조에는 독자적인 연구 기술인 Polynorm(전문가별 활성화 함수)이 적용되었으며, Gated Differential Latent Attention(GDLA)으로 추정되는 차분 어텐션 변형 기술이 도입되었다. 또한, 성능 향상을 위해 수정된 mHC(modified mHC) 구조를 채택했다. 이번 출시는 오픈 웨이트 모델 분야에서 한국 기술의 경쟁력을 확인할 수 있는 중요한 사례로 주목받고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @eliebakouch: huge open weight release, motif (korean company) just released a 13B active 314B total MoE performing on par with bigger models li
원문 보기 ↗