참고X
코딩 에이전트 성능의 함정: SWE Refactor Bench 분석
테스트 통과율과 실제 태스크 완료율 간의 괴리 확인. 에이전트 도입 시 주의할 점 시사.
요약
최신 'SWE Refactor Bench' 평가 결과에 따르면, 코딩 에이전트가 단위 테스트를 통과하더라도 실제 과제를 완수하지 못하는 사례가 빈번한 것으로 나타났다. 전체 520회의 실행 중 340회가 마이그레이션 감사를 완료했으며, 고정된 모든 테스트를 통과한 경우는 88회에 그쳤다. 최종적으로 3단계 전체 평가를 모두 통과한 사례는 단 28회뿐이다. 이러한 평가 결과의 격차는 현재 자율형 전체 리포지토리(whole-repo) 리팩토링 기술이 직면한 실제 수준을 보여준다. 테스트 통과 여부가 곧 실제 작업 성공을 보장하지 않는다는 점이 실무적 한계로 지적된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: Coding agents can pass tests and still miss the task. In SWE Refactor Bench, 340 of 520 runs completed the migration audit. 88 pas
원문 보기 ↗