SWE-Prime: 10%의 학습 데이터로 코딩 성능 향상
코딩 에이전트 학습 데이터 큐레이션 효율성을 제시한 연구.
요약
SWE-Prime은 성공적인 코딩 에이전트의 궤적이라도 중복되거나 비효율적인 단계가 포함되어 있을 수 있다는 점에 주목하여, 이를 필터링하는 2단계 학습 방식을 제안했다. 연구진은 전체 성공 궤적 데이터 중 10%만을 선별하여 모델을 학습시킨 결과, SWE-Bench Pro 및 Verified에서 전체 데이터를 사용했을 때보다 최대 12.2% 및 24.2%의 성능 향상을 기록했다고 밝혔다. 이는 단순히 ‘테스트 통과’ 여부만으로 데이터를 라벨링하는 기존 방식이 학습 과정에서 불필요한 시행착오나 불안정한 해결 방식을 모방하게 할 위험이 있음을 시사한다. 현재 이 연구는 사전 공개 논문 형태이며 특정 벤치마크 기반의 결과이지만, 코딩 에이전트 학습 시 프로세스 품질을 어떻게 평가할지에 대한 중요한 화두를 던지고 있다. 데이터의 양보다 실질적으로 학습에 기여하는 질 높은 궤적 선별이 모델의 성능 최적화에 더 효과적일 수 있음을 입증했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 SWE-Prime trained on 10% of successful coding trajectories and beat the full set. Are success labels too noisy?
원문 보기 ↗