알리바바, 이미지 생성 및 편집 통합 오픈 모델 'Swift-Image 6B' 공개
텍스트-이미지 생성과 멀티 이미지 편집을 단일 6B 파라미터 모델로 통합하여 효율성을 높인 오픈 소스 모델.
요약
알리바바가 텍스트-이미지 생성, 단일 이미지 편집, 다중 이미지 편집을 통합적으로 수행하는 새로운 경량 오픈 이미지 모델 Swift-Image 6B를 공개할 가능성이 제기되었다. Swift-Image 6B의 시각적 렌더러는 비전-언어 인코더의 멀티모달 표현을 조건으로 하는 6B 파라미터 규모의 병렬 단일 스트림 DiT 구조를 채택했다. 이 모델은 블록 공유 타임스텝 변조, 병렬 어텐션 및 MLP 연산, 4D 회전 위치 인코딩 기술 등을 적용하여 효율적인 아키텍처를 구현했다. 특히 이미지 내 텍스트 생성을 위해 문자 단위 토큰화(Character-level tokenization)를 적용했으며, 다중 이미지 위치 오프셋 등을 통해 참조 조건 기반의 정교한 편집을 지원한다. 이번 연구는 다양한 생성 작업과 편집 기능을 단일 생성 백본으로 통합하여 처리할 수 있는 가능성을 제시하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Alibaba might release a new open image model Swift-Image 6B
원문 보기 ↗