오픈소스 LLM/멀티모달 강화학습 프레임워크 'Miles' v0.1 공개
대규모 모델의 분산 강화학습 파이프라인 최적화 및 운영 효율을 개선하는 새로운 오픈소스 도구.
요약
오픈소스 강화학습(RL) 프레임워크 'Miles v0.1'이 공개되었다. 이 프레임워크는 LLM 및 멀티모달 모델의 RL 학습을 쉽게 시작하고, 대규모 환경에서도 효율적인 하드웨어 활용과 디버깅을 지원한다. 지난 9개월간 72명의 기여자가 1,326개의 커밋과 85개의 GPU E2E CI 테스트를 통해 Kimi K3, DeepSeek V4, Qwen 3.8 등 최신 모델을 대상으로 검증을 마쳤다. 현재 IBM, Nebius AI, Periodic Labs 등 다양한 기업의 프로덕션 RL 워크로드에 도입되어 NVIDIA 및 AMD 하드웨어 환경에서 운영되고 있다. 특히 트릴리온 파라미터 모델 학습 시 롤아웃 처리량을 3배, 가중치 동기화를 10배, 가중치 변환 속도를 30배 개선하는 성과를 보였다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @radixark: Today we're launching Miles v0.1, an open-source RL framework for LLMs and multimodal models. RL training is easy to start and har
원문 보기 ↗