코딩 에이전트 성능 80% 향상시키는 'Harness-of-Harness' 프레임워크
반복적인 계획과 테스트 루프를 통해 에이전트의 소프트웨어 개발 성공률을 획기적으로 높이는 구조 제안.
요약
최근 연구원들이 공개한 'Harness-of-Harness'는 기존 코딩 에이전트를 반복적인 계획, 코딩, 독립적 테스트 루프에 포함시켜 자율 소프트웨어 개발 역량을 크게 강화한 시스템이다. 이 시스템은 반복 과정에서 프로젝트 상태와 증거를 보존하여 에이전트가 문맥을 잃지 않고 지속적으로 개선될 수 있도록 돕는다. 실제 테스트 결과, Codex with GPT-5.5, OpenCode with DeepSeek-V4-Pro, Pi with MiniMax-M3 등을 사용했을 때 평균 52.25%, 최대 82.86%의 성능 향상을 기록했다. 특히 FrontierSWE 벤치마크에서는 Codex with GPT-5.5가 10회 반복을 통해 22%에서 72.67%로 성공률이 급증했다. 70회 이상의 반복을 거친 며칠간의 구동 테스트에서 고수준 요구사항만으로 스토리라인, 메커니즘, UI, 오디오를 포함한 완성도 높은 FPS 게임을 자율적으로 개발하는 성과를 보였다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @mark_k: This is a big step toward autonomous software development that runs for days, not minutes. Researchers introduced Harness-of-Harne
원문 보기 ↗