코딩 에이전트의 루프 방식 개선: 'Harness-of-Harness' 논문 공개
에이전트 워크플로우를 짧은 계획-코딩-테스트 루프로 래핑해 성능을 최대 82% 향상시키는 기법.
요약
코딩 에이전트가 시간이 지날수록 성능이 저하되는 문제를 해결하기 위한 새로운 연구 'Harness-of-Harness'가 공개되었습니다. 이 방식은 기존 코딩 환경을 짧은 계획, 코딩, 테스트 루프로 감싸 각 단계를 개별적으로 검증하는 구조를 갖추고 있습니다. GameCraft-Bench, FrontierSWE, ProgramBench 등 3개 벤치마크 환경에서 3개 모델 조합으로 테스트한 결과, 3회 반복 후 평균 52.25%, 최대 82.86%의 성능 향상을 기록했습니다. 특히 70회 이상의 반복 과정을 통해 스토리, 메커니즘, 그래픽, 오디오를 모두 포함한 완전한 형태의 FPS 게임을 단독으로 개발해냈습니다. 기존 에이전트의 장기적인 성능 저하 문제를 효과적으로 개선할 수 있는 기술적 접근법으로 평가받습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @godofprompt: Most coding agents get worse the longer you leave them alone. A new paper called Harness-of-Harness digs into that. Here’s how it
원문 보기 ↗