코딩 에이전트 성능 극대화한 'Marathoner' 공개: 9B 모델의 가능성
Qwen3.5-9B 기반으로 장기 코딩 작업과 신뢰성 높은 도구 호출 능력을 입증한 연구로, 소형 모델의 에이전트 잠재력을 시사함.
요약
앤트 그룹(Ant Group), 베이킹 대학교, 마카오 대학교 연구진이 10시간 이상 코딩을 지속하고 1,000회 이상의 툴 호출이 가능한 모델 'Marathoner'를 공개했다. Qwen3.5-9B를 기반으로 구축된 이 모델은 1만 개 저장소의 10만 건 이상의 GitHub PR에서 추출한 소프트웨어 작업으로 학습되었으며, 실제 실행 환경에서 강화 학습을 수행한다. 특히 작업 후반부에 유용한 진전을 보일 경우 보상을 주는 방식을 도입해 성능을 크게 향상했다. 그 결과 SWE-bench Verified에서 43.8%에서 77.5%로, Terminal-Bench 2.0에서 27.3%에서 57.2%로 성능이 대폭 상승했다. Marathoner는 9B라는 소형 모델임에도 불구하고 AI 에이전트의 지속적인 작업 수행 능력을 입증했다는 점에서 중요한 연구 사례로 평가받는다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @mark_k: A 9B model that can keep coding for 10+ hours and make 1,000+ tool calls. That's what researchers from Ant Group, Peking Universit
원문 보기 ↗