MiniMax H3 모델 가중치 최적화로 VRAM 요구량 대폭 절감
2688 차원 연산의 비효율을 수정해 24GB VRAM 환경에서도 원활하게 구동 가능. 로컬 모델 배포 시 참고할 만한 최적화 사례.
요약
MiniMax H3 모델은 표기상 33.1B 파라미터이나, 추론 과정에서 AdaLN 투영 레이어가 2688개의 입력값 중 1개의 타임스텝 값만 활용한다는 사실이 확인되었습니다. 이 불필요한 입력 구조를 수정하여 가중치를 최적화하면 모델 품질 저하 없이 최대 26GB의 VRAM을 절약할 수 있습니다. 결과적으로 INT8 기준 20GB VRAM으로 모델 구동이 가능해져 RTX 3090/4090 및 RX 7900 XTX 등 일반 소비자용 GPU에서 실행이 가능합니다. 이외에도 텍스트 인코더인 Qwen3-VL-32B의 레이어 일부와 비디오/오디오 VAE를 포함한 MiniMax H3의 전체 파라미터 규모는 48.8B로 분석되었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Repost because not everyone can read blurry photos or long threads: MiniMax H3 is confirmed to be 33.1B parameters, but testers found out it's effectively 20.1B due to a 2688-dimensional oversight (and that's a VERY good thing for us!)
원문 보기 ↗