4GB VRAM으로 70B 모델 구동? AirLLM, MoE 모델 스트리밍 추론 지원
거대 MoE 모델의 필요한 전문가(Expert)만 로드해 VRAM 점유율을 획기적으로 낮춤. 로컬 환경에서 대형 모델을 실행하는 개발자에게 유용한 최적화 도구.
요약
AirLLM은 양자화나 가지치기 없이도 대규모 언어 모델(LLM)의 추론 메모리 사용량을 획기적으로 줄여, 단일 4GB GPU 환경에서 70B 모델을 구동할 수 있도록 지원합니다. 특히 희소 MoE(Sparse MoE) 모델을 처리할 때 전체 레이어가 아닌 필요한 전문가(expert)만 순차적으로 로드하는 방식으로 효율성을 극대화했습니다. 이를 통해 405B 규모의 Llama 3.1은 8GB GPU에서, DeepSeek-V3(671B)는 약 12GB 환경에서 구동 가능하며, 2.8T 규모의 Kimi K3 모델도 4GB 미만의 VRAM에서 실행할 수 있습니다. Kimi K3 구동을 위해서는 압축 텐서 라이브러리, 특정 버전의 Flash Attention, CUDA 12 기반 Torch, Transformers 4.56.x 버전 등의 환경 설정이 필수적입니다. v3.0 업데이트를 통해 FP8 모델을 지원하며, 최신 모델인 Qwen3, Phi-4, Gemma 등 다양한 모델을 단일 AutoModel 인터페이스로 통합 운영할 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 AirLLM 70B inference with single 4GB GPU
원문 보기 ↗