LoRA 학습 시 배치 크기와 가속기 물리적 배치에 따른 성능 차이 분석
동일한 유효 배치 크기라도 GPU 효율은 다를 수 있음. T4/L4 환경별 학습 시간 비교 데이터.
요약
Qwen3-1.7B 모델을 TRL과 LoRA로 100회 최적화 업데이트한 결과, 동일한 유효 배치(Effective Batch) 크기라도 물리적 배치 구성에 따라 학습 속도 차이가 크게 나타났다. T4 GPU 환경에서는 물리적 배치를 4×1로 구성할 때 1×4보다 약 17% 빠른 학습 성능을 보였고, L4 GPU에서는 그 차이가 약 41%까지 벌어졌다. 이는 유효 배치가 같더라도 실제 GPU가 처리하는 물리적 배치의 실행 형태가 다르기 때문에 발생하는 현상이다. 1×4 구성은 4번의 작은 연산을 수행한 뒤 옵티마이저를 업데이트하지만, 4×1 구성은 1번의 큰 연산을 수행한다. 결과적으로 배치 구성이 GPU 실행 효율에 직접적인 영향을 미치므로, 단순 유효 배치 유지보다는 물리적 배치 최적화가 학습 효율에 중요하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Same effective batch does not mean same training time with gradient accumulation, tested on LoRA on T4 and L4 [D]
원문 보기 ↗