← promppy_ 실시간 AI 뉴스
참고팁Reddit

DGX Spark 기반 35B MoE 모델 팀 단위 온프레미스 배포 성공기

3B 활성 파라미터 모델과 vLLM을 조합하여 단일 워크스테이션으로 20인 규모 팀의 추론 수요를 분당 490 토큰 속도로 처리한 사례.

요약

최근 20명 규모의 팀이 데스크톱 환경에서 오픈소스 거대언어모델(LLM)을 성공적으로 자체 호스팅한 사례가 공유되었다. 핵심은 35B 총 파라미터 중 3B만 활성화되는 MoE 모델인 Ornith-1.5-35B-A3B를 사용하여 컴퓨팅 효율을 극대화한 것이다. 하드웨어는 128GB 통합 메모리를 갖춘 NVIDIA DGX Spark를 사용했으며, 22GiB 용량의 4-bit NVFP4 체크포인트를 활용했다. vLLM 0.24 버전의 멀티 토큰 예측 기능을 적용한 결과, 사용자 1인 사용 시 초당 79토큰, 20인 동시 접속 시에도 각각 초당 25토큰 수준의 빠른 처리 속도를 구현했다. 이번 사례는 적절한 모델 선택과 효율적인 설정만으로 단일 장비로 팀 전체의 AI 요구사항을 처리할 수 있음을 입증했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Self-hosting a 35B MoE for a 20-person team on one desktop box: what it took and what it does (all open source)

원문 보기 ↗

광고

다음 뉴스 →

중요배경훈 부총리 "독파모는 산업·공공 확산, 프런티어 AI는 초지능·사이버안보" 투트랙

정부 AI 지원이 두 축으로 분리. 과제 성격에 맞춰 R&D·사업 지원 트랙 선택 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스