Qwen3.8-Flash-Next 기반 경량화 모델 'Victoria' 공개
REAP 기법을 통해 파라미터 44%를 절감한 모델로, 로컬 LLM 환경에서 코딩 및 에이전트 작업 최적화 사례로 참고할 가치가 있습니다.
요약
Dell B300을 활용하여 Qwen3.8-Flash-Next를 기반으로 한 오픈 웨이트 모델 2종 'Victoria'와 'Maple'이 공개되었습니다. 코딩 및 에이전트 특화 모델인 Victoria는 REAP 기술을 통해 레이어당 전문가를 512개에서 288개로 44% 축소했으며, 학습 단계부터 4-bit(NVFP4)로 훈련되어 양자화 효율을 높였습니다. 성능 평가에서 Victoria는 Terminal-Bench 2.1 70.0%, HumanEval 159/164를 기록했으며, 전용 드래프트 헤드 사용 시 Dell B300 환경에서 단일 스트림 기준 280 tok/s의 속도를 보였습니다. 또한 GGUF Q4_K_M 버전은 49.17 GiB 용량에 Terminal-Bench 75.3%의 성능을 달성했습니다. 함께 공개된 Maple은 캐나다 관련 데이터에 최적화된 파인튜닝 모델로, 로컬 LLM 환경에서의 활용성을 넓혔습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Two open-weights releases: Victoria (Qwen3.8-Flash-Next with 44% of experts cut, 70% Terminal-Bench 2.1, GGUF included) and Maple (a Canada-first fine-tune)
원문 보기 ↗