초경량 고성능 이미지 모델 'Agate-003-preview' 공개
300M 이하 파라미터로 SD 1.5 능가 성능. 로컬 환경 이미지 생성 파이프라인 최적화에 주목.
요약
Agate-003-preview는 텍스트 인코더와 VAE를 포함해 300M 미만의 파라미터로 Stable Diffusion 1.5보다 뛰어난 성능을 보여주는 경량 이미지 생성 모델이다. 5,000유로 규모의 GPU 비용만으로 학습된 이 모델은 낮은 해상도에서 계획을 세우는 '플래너'와 이를 구체화하는 '페인터/렌더러'의 이원화 구조를 사용한다. 플래너는 트랜스포머 기반으로 텍스트 토큰에 크로스 어텐션을 수행하며, 렌더러는 완전 컨볼루션 방식(fully convolutional)을 채택해 효율적인 이미지 생성을 지원한다. 이번 업데이트에서는 256x256 해상도의 Agate-002-preview에 이어, 학습된 다운샘플러/업샘플러를 적용해 512x512 네이티브 해상도를 지원하도록 개선되었다. 해당 파라미터 규모 내에서는 현재 최고 수준(SoTA)의 성능을 기록하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 [RELEASE UPDATE] Agate-003-preview / better than SD 1.5 performance at 3x less parameters (<300M param including text encoder & VAE) with only 5000 EUR GPU cost.
원문 보기 ↗