Diffusers, Nunchaku 4비트 확산 모델 추론 공식 지원
별도 라이브러리 없이 Diffusers 내에서 4비트 양자화 모델을 즉시 로드 및 실행 가능.
요약
Hugging Face는 SVDQuant 기반의 Nunchaku 4-bit 추론 기술을 Diffusers 라이브러리에 통합하여 별도의 추론 엔진 없이 모델을 즉시 활용할 수 있게 했다. 기존의 Weight-only 양자화 방식과 달리, Nunchaku는 W4A4(4-bit 가중치 및 활성화 함수) 방식을 채택해 메모리 절감은 물론 추론 속도까지 향상시켰다. 이제 Diffusers에서 from_pretrained() 메서드를 호출하는 것만으로 Nunchaku 체크포인트를 바로 로드할 수 있으며, 별도의 로컬 CUDA 컴파일도 필요 없다. diffuse-compressor 툴킷을 사용하면 사용자가 직접 새로운 아키텍처를 양자화하여 배포하는 것도 가능하다. 실제 Nunchaku NVFP4 트랜스포머와 bitsandbytes NF4 텍스트 인코더를 결합한 모델은 1024x1024 해상도 이미지를 약 1.7초 만에 생성한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Bringing Nunchaku 4-bit Diffusion Inference to Diffusers
원문 보기 ↗