← promppy_ 실시간 AI 뉴스
참고X

코딩 에이전트 성능의 함정: SWE Refactor Bench 분석

테스트 통과율과 실제 태스크 완료율 간의 괴리 확인. 에이전트 도입 시 주의할 점 시사.

요약

최신 'SWE Refactor Bench' 평가 결과에 따르면, 코딩 에이전트가 단위 테스트를 통과하더라도 실제 과제를 완수하지 못하는 사례가 빈번한 것으로 나타났다. 전체 520회의 실행 중 340회가 마이그레이션 감사를 완료했으며, 고정된 모든 테스트를 통과한 경우는 88회에 그쳤다. 최종적으로 3단계 전체 평가를 모두 통과한 사례는 단 28회뿐이다. 이러한 평가 결과의 격차는 현재 자율형 전체 리포지토리(whole-repo) 리팩토링 기술이 직면한 실제 수준을 보여준다. 테스트 통과 여부가 곧 실제 작업 성공을 보장하지 않는다는 점이 실무적 한계로 지적된다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @kimmonismus: Coding agents can pass tests and still miss the task. In SWE Refactor Bench, 340 of 520 runs completed the migration audit. 88 pas

원문 보기 ↗
다음 뉴스 →

중요미스터리 모델 'Ox Alpha' 정체는 Z.ai…최신 GLM 시리즈로 수요일 가중치 공개

코딩·장기 에이전트 작업용 오픈 가중치 추론 모델. 벤치마크 상위권, 자체 호스팅 대안으로 검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스