Qwen3.8-Flash-Next 기술 세부사항: 6B 활성 파라미터로 달성한 효율성
Gated DeltaNet과 N-gram 임베딩 등 새로운 아키텍처 도입으로 연산 효율 극대화. 경량화 및 고성능 오픈 모델 아키텍처에 관심 있다면 필독.
요약
Qwen3.8-Flash-Next는 125B MoE 파라미터와 51B N-gram 임베딩을 결합하여 토큰당 6B 파라미터만 활성화하는 효율적인 모델이다. Gated DeltaNet, Qwen Sparse Attention, Gated Residual 연결, N-gram 임베딩, Muon 기반 학습 레시피 등 4가지 주요 기술 변화를 도입했다. 학습 비용은 기존 Qwen3.7-Plus 대비 9분의 1 수준으로 줄었으나 DeepSWE 1.1에서 58.7, SWE-bench Pro에서 62.5, CoWorkBench에서 73.9의 점수를 기록했다. 특히 백만 토큰 컨텍스트 길이에서 프리필 속도는 최대 7.6배, 디코딩 속도는 4.9배 빨라졌다. 이번 모델은 더 많은 파라미터를 사용하면서도 토큰당 연산량을 획기적으로 줄이는 향후 모델 스케일링의 방향성을 보여준다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: A bit more tl;dr about the model: Qwen3.8-Flash-Next combines 125B MoE parameters with 51B N-gram embeddings, while activating onl
원문 보기 ↗