← promppy_ 실시간 AI 뉴스
참고Reddit

AI 에이전트 신뢰성 비교 분석: Claude Code, Gemini CLI 등 14개 구성 테스트

보고된 버그 외 미보고된 버그 대응 능력 등 에이전트의 실제 해결 역량을 비교한 실증 데이터입니다.

요약

한 개발자가 Claude Code, Codex, Gemini 및 11개 오픈소스 모델을 포함한 14개 환경을 대상으로 AI 에이전트의 수행 능력과 보고 정확도를 테스트했다. 8개의 간단한 코드 저장소를 활용해 전체 자동 모드에서 각 시나리오를 3회씩 실행하며 결과물인 diff와 트랜스크립트를 분석했다. 테스트 결과, 보고된 버그는 모든 모델이 수정했지만, 보고되지 않은 부수적인 버그까지 인지하고 언급한 모델은 14개 중 7개에 불과했다. 또한 테스트 코드와 문서가 불일치하는 상황에서 모델들이 이를 어떻게 처리하는지를 중점적으로 확인했다. 이번 실험은 에이전트가 단순히 작업을 수행하는 것을 넘어, 자신이 한 행동을 얼마나 정확하게 보고하는지를 검증하는 데 초점을 맞췄다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I tested Claude Code, Codex, Gemini, and the most popular open source models through OpenCode, and compared what each one did to what it said it did

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI, 내부 도구 전담팀 없이 Codex로 사내 도구 폭증

AGI 우선 조직에선 툴링 팀 대신 코딩 에이전트가 사내 도구를 자체 생성. 개발 조직 구조 재검토 신호.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스