코딩 에이전트의 일관성 부족: 8개 모델 대상 테스트 결과 절반 이상이 '복불복'
동일 프롬프트·커밋에서도 에이전트 결과값이 매번 달라짐. 결정론적 수행이 보장되지 않으므로 워크플로우 설계 시 재시도 로직 필수.
요약
최근 한 연구에서 동일한 코드 커밋과 프롬프트에 대해 코딩 에이전트가 매번 다른 결과값을 내놓는 비결정론적 특성이 확인됐다. 8개 모델을 대상으로 10개 작업(작업당 8회 실행)을 수행한 결과, 80개 케이스 중 모든 실행에서 성공한 경우는 6건에 불과했고, 41건은 성공과 실패가 혼재된 결과(mixed)를 보였다. 이는 코딩 에이전트 작업의 50% 이상이 결과 재현성을 보장하지 못한다는 것을 의미한다. 심지어 Temperature 0 설정으로도 이러한 결과 차이를 완전히 해결할 수 없는데, 이는 토큰 생성이 확률 분포에 기반한 추출 과정이기 때문이다. 실무자들은 코딩 에이전트 활용 시 동일 작업에 대해서도 결과값이 항상 일정하지 않다는 점을 인지하고 반복적인 검증 프로세스를 고려해야 한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Same prompt, same commit, two different diffs: a leaderboard that printed every single trial shows how often "can the agent do this" comes out as "sometimes"
원문 보기 ↗