중요HF Blog
AI2, 조 단위 파라미터 MoE 학습 인프라 'Olmo-core 3' 오픈소스 공개
소규모 랩·학계도 대형 MoE 학습 가능. 자체 모델 사전학습 고려 시 검토 가치 있음.
요약
Hugging Face는 대규모 언어 모델 개발을 위한 새로운 오픈 프레임워크인 Olmo-core 3를 공개했다. 이 시스템은 트릴리온 파라미터 규모의 Mixture-of-Experts(MoE) 학습을 효율적으로 확장하도록 설계되었다. 기존 MoE 모델은 파라미터가 커질수록 통신 및 조정 비용이 증가해 계산 효율성이 떨어지는 문제가 있었으나, Olmo-core 3는 이를 최적화하여 이러한 간극을 줄였다. 실제 벤치마크 테스트에서 전문가 풀을 8개에서 128개로 늘리면서도 토큰당 활성 파라미터 수를 약 3.2B로 일정하게 유지했다. 이번 출시는 대규모 모델 학습의 비용과 에너지 문제를 해결하고, 학계 및 소규모 연구소의 접근성을 높이려는 노력의 일환이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs
원문 보기 ↗