DGX Spark 기반 35B MoE 모델 팀 단위 온프레미스 배포 성공기
3B 활성 파라미터 모델과 vLLM을 조합하여 단일 워크스테이션으로 20인 규모 팀의 추론 수요를 분당 490 토큰 속도로 처리한 사례.
요약
최근 20명 규모의 팀이 데스크톱 환경에서 오픈소스 거대언어모델(LLM)을 성공적으로 자체 호스팅한 사례가 공유되었다. 핵심은 35B 총 파라미터 중 3B만 활성화되는 MoE 모델인 Ornith-1.5-35B-A3B를 사용하여 컴퓨팅 효율을 극대화한 것이다. 하드웨어는 128GB 통합 메모리를 갖춘 NVIDIA DGX Spark를 사용했으며, 22GiB 용량의 4-bit NVFP4 체크포인트를 활용했다. vLLM 0.24 버전의 멀티 토큰 예측 기능을 적용한 결과, 사용자 1인 사용 시 초당 79토큰, 20인 동시 접속 시에도 각각 초당 25토큰 수준의 빠른 처리 속도를 구현했다. 이번 사례는 적절한 모델 선택과 효율적인 설정만으로 단일 장비로 팀 전체의 AI 요구사항을 처리할 수 있음을 입증했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Self-hosting a 35B MoE for a 20-person team on one desktop box: what it took and what it does (all open source)
원문 보기 ↗