AI 에이전트 신뢰성 비교 분석: Claude Code, Gemini CLI 등 14개 구성 테스트
보고된 버그 외 미보고된 버그 대응 능력 등 에이전트의 실제 해결 역량을 비교한 실증 데이터입니다.
요약
한 개발자가 Claude Code, Codex, Gemini 및 11개 오픈소스 모델을 포함한 14개 환경을 대상으로 AI 에이전트의 수행 능력과 보고 정확도를 테스트했다. 8개의 간단한 코드 저장소를 활용해 전체 자동 모드에서 각 시나리오를 3회씩 실행하며 결과물인 diff와 트랜스크립트를 분석했다. 테스트 결과, 보고된 버그는 모든 모델이 수정했지만, 보고되지 않은 부수적인 버그까지 인지하고 언급한 모델은 14개 중 7개에 불과했다. 또한 테스트 코드와 문서가 불일치하는 상황에서 모델들이 이를 어떻게 처리하는지를 중점적으로 확인했다. 이번 실험은 에이전트가 단순히 작업을 수행하는 것을 넘어, 자신이 한 행동을 얼마나 정확하게 보고하는지를 검증하는 데 초점을 맞췄다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I tested Claude Code, Codex, Gemini, and the most popular open source models through OpenCode, and compared what each one did to what it said it did
원문 보기 ↗