참고Reddit
8B 파라미터 MoE 모델 'Ling-3.0-tiny' 오픈 웨이트 공개
8B 크기의 MoE 모델로 추론 속도와 리소스 효율성을 중시하는 로컬 LLM 사용자에게 실용적인 선택지.
요약
inclusionAI 팀이 새로운 경량화 모델인 Ling-3.0-tiny를 오픈 웨이트로 공개했다. 해당 모델은 총 파라미터 8B 중 1.3B를 활성화하는 MoE(Mixture of Experts) 구조를 채택했으며, 성능 면에서는 4B~12B급인 Qwen 및 Gemma 모델 사이 수준을 보여준다. 속도 측면에서 FP8 양자화 적용 시 DGX Spark에서 약 100~105 tokens/s, M4 Pro MacBook에서 약 86~90 tokens/s의 처리 성능을 기록했다. 8K 컨텍스트 길이 기준 약 8.34 GiB의 메모리 사용량을 보여 효율적인 온디바이스 AI 구동에 유리할 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 inclusionAI/Ling-3.0-tiny · 8B A1.3B MoE· Hugging Face
원문 보기 ↗