중요X
DeepSeek, 네이티브 비전 지원 경량 모델 'DeepSeek-V4.1-Flash' 공개
552B MoE에 입력 8B·출력 16B 활성. 비대칭 구조로 추론 비용 낮춰 서빙 최적화 검토 가치.
요약
DeepSeek이 더 빠르고 효율적인 최신 소형 모델 DeepSeek-V4.1-Flash를 공개했다. 이 모델은 새로운 비대칭 아키텍처를 도입하여 향상된 능력과 빠른 추론 속도, 높은 처리량을 제공하며 기본적으로 시각적 이해 기능을 갖췄다. 552B 파라미터 MoE 기반의 이 모델은 새로운 Causal Encoder-Decoder 구조를 통해 입력 시 8B, 출력 시 16B의 활성 파라미터만 사용하여 비용을 절감했다. 또한, 새로운 사전 학습 방법과 대규모 강화학습 사후 학습을 적용하여 DeepSeek-V4-Pro를 포함한 기존 플래그십 모델들을 앞서는 벤치마크 성능을 기록했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @deepseek_ai: 🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture fam
원문 보기 ↗