참고Reddit
오픈소스 모델 'K2-Horizon-MoVA-36B' 공개
MoVA 아키텍처를 도입한 36B 파라미터 규모의 모델로, 에이전트 및 추론 성능 개선을 강조함.
요약
IFM은 Mixture-of-Experts(MoE) 구조와 Mixture-of-Values attention(MoVA)을 적용한 신규 모델 K2-Horizon-MoVA-36B-A4B를 공개했다. 이 모델은 전체 36B 파라미터 규모지만, 토큰당 4B 파라미터만을 활성화하는 희소(sparse) 모델로 효율성을 극대화했다. 에이전트 및 추론 벤치마크에서 기존의 30B급 dense 모델이나 파라미터 규모가 최대 15배 큰 MoE 모델들을 상회하는 성능을 기록했다. IFM은 이번 36B 모델 외에도 K2-Horizon 제품군으로 32B, 7B, 3.7B, 0.9B 크기의 GGUF 버전 모델들을 추가로 배포했다. 현재 최종 체크포인트가 공개되었으며, 향후 중간 체크포인트와 학습 데이터 및 코드도 순차적으로 공개될 예정이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 IFM/K2-Horizon-MoVA-36B-A4B-GGUF · Hugging Face
원문 보기 ↗