참고팁Reddit
단일 GPU 환경에서 DiT 모델 학습 시 발견된 3가지 기술적 사실
소규모 DiT 모델을 직접 학습하며 발견한 어텐션 싱크, 토큰 norm 현상 등 최적화 실무 데이터.
요약
한 개발자가 210M 파라미터 규모의 텍스트 투 이미지(text-to-image) 확산 변환기(DiT)를 RTX PRO 6000 GPU 1대로 3.5일간 256x256 해상도 이미지 420만 장을 학습시킨 사례를 공유했다. 학습 과정에서 두 개의 학습된 Key/Value 슬롯이 노이즈 중간 단계에서 크로스 어텐션 가중치의 약 90%를 흡수하는 현상이 관찰되었다. 기존 모델에서 어텐션의 중심 역할을 하던 EOS 토큰의 가중치는 4%로 급감했으며, 레지스터 벡터는 이미지 토큰 노름의 4~13배까지 성장하는 것으로 나타났다. 이번 실험은 대규모 학습 없이도 모델 내부 어텐션 메커니즘의 동적 변화를 구체적으로 측정했다는 점에서 의미가 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Training a 210M text-to-image DiT from scratch on one GPU: what I measured [P]
원문 보기 ↗