NVIDIA, 고속 추론 특화 오픈 웨이트 모델 'Nemotron 3.5 Lightning' 공개
30B MoE(활성 3B) 구조와 1M 컨텍스트 지원. 경량·고속 추론이 필요한 로컬 배포 환경에서 새로운 효율성 대안으로 검토할 만함.
요약
NVIDIA가 30B MoE(Mixture-of-Experts) 구조에 3B 활성 파라미터를 갖춘 신규 모델 'Nemotron 3.5 Lightning'을 공개했다. 이 모델은 1M 토큰의 컨텍스트 윈도우를 지원하며 가중치를 오픈하여 AI/ML API에서 무료로 사용할 수 있다. NVIDIA는 해당 모델이 동급 경쟁 모델 대비 최대 4배 빠른 출력 속도를 제공한다고 밝혔다. AI/ML API의 성능 테스트 결과, 냅킨에 묻은 얼룩 3개를 인식하여 단일 HTML 파일로 애니메이션 행성계로 변환하는 복잡한 작업을 정확히 수행했다. 경량 모델임에도 불구하고 뛰어난 추론 능력을 입증했다는 평가를 받는다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ai_for_success: NVIDIA's new Nemotron 3.5 Lightning is now available for free on AI/ML API. It's a 30B MoE model with just 3B active parameters, a
원문 보기 ↗