참고X
[화제] 주요 차세대 MoE 모델 파라미터/활성 파라미터 비교 분석
DeepSeek V4, Kimi K3, Qwen3.8 등 최신 모델들의 파라미터 구조와 활성률 분석.
요약
최근 공개된 주요 대규모 언어 모델(LLM)들의 파라미터 구성 정보가 공유되었습니다. DeepSeek V4 Pro는 1.6T 파라미터에 49B 활성(3%)을 기록했습니다. Kimi K3는 2.8T 파라미터와 104B 활성(3.5%)으로 구성되었으며, Qwen3.8-Max는 2.4T 파라미터 중 95B를 활성(4%)으로 사용합니다. GLM-5.2 모델은 750B 파라미터에 40B 활성(5%)을 보였습니다. 공개된 모델들은 전체 파라미터 대비 약 3~5% 수준의 활성 파라미터를 사용하여 효율성을 추구하는 공통된 패턴을 나타내고 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @MarcosHernanz: DeepSeek V4 Pro: - 1.6T params / 49B active (3%) Kimi K3: - 2.8T params / 104B active (3.5%) Qwen3.8-Max - 2.4T params / 95B activ
원문 보기 ↗