참고팁Reddit
Claude Code(클로드 코드)의 '/goal' 검증 기능 한계 분석 및 대안 제언
AI 에이전트 결과물 검증 시 LLM의 자체 평가에만 의존할 때의 위험성을 지적한 실무 분석입니다.
요약
Claude Code의 '/goal' 기능은 사용자가 정의한 목표 달성 여부를 Haiku 모델이 대화 기록만을 분석해 판단하는 방식이다. 그러나 벤치마크 결과, 17번의 테스트 중 17번 모두 완료되었다고 판단했음에도 실제로는 8번이 실패한 것으로 나타났다. 특히 하위 모델인 Haiku의 경우 7번의 오류가 발생했으며, 최악의 사례는 숨겨진 체크포인트를 4%만 통과했다. 모델이 에이전트의 대화 내용에만 의존해 판단을 내리는 구조적 한계가 드러난 것이다. 이에 대안으로 대화 기록 외부에서 목표를 확인하는 'goalpost'라는 오픈소스 도구가 대안으로 제시되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 An LLM judge that only reads the transcript said "done" in 17 of 17 runs. 8 were broken. Notes from benchmarking Claude Code's /goal
원문 보기 ↗