← promppy_ 실시간 AI 뉴스
참고HF Papers

Qwen3.8-Flash-Next 아키텍처 상세 분석 및 훈련 효율화 전략

Qwen3.8-Flash-Next의 희소 MoE 구조와 효율화 기술 공개. 고성능 모델의 경량화 및 훈련 최적화 기법 연구에 유용한 자료.

요약

Qwen3.8-Flash-Next는 125B 파라미터 규모의 희소 전문가 혼합(MoE) 모델로, 토큰당 6B 파라미터를 활성화하며 가속기 외부에 51B 파라미터의 n-gram 임베딩 테이블을 별도로 운용한다. 이 모델은 기존 397B-A17B 모델 대비 1/3의 활성 파라미터와 1/9 수준의 학습 FLOPs를 사용하면서도, 14개 벤치마크 중 8개 항목에서 기존 성능을 상회하는 효율성을 입증했다. 모델 아키텍처는 Gated DeltaNet(GDN)과 글로벌 어텐션을 층별로 혼합하고, 사전 학습 후 Qwen Sparse Attention(QSA)을 적용하는 방식을 채택했다. 또한, 잔차 스트림을 4개 브랜치로 확장한 Gated Residual(GR) 설계를 도입하여 학습 안정성을 높였다. Muon 옵티마이저와의 결합을 통해 최적 학습률과 배치 사이즈를 상향 조정했으며, 배치 사이즈 워밍업 과정 없이도 안정적인 학습 성능을 보장한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability

원문 보기 ↗
다음 뉴스 →

속보Anthropic, 데이터 무보존과 오용 탐지 결합한 엔터프라이즈 보안 솔루션 'EFS' 발표

데이터를 고객 클라우드에 저장해 ZDR과 오용 탐지 양립. 규제산업 도입 문턱 낮아짐

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스