에이전트 행동 중심 평가 벤치마크 'CommerceAgentBench' 공개
LLM 출력물 평가를 넘어 실제 에이전트의 워크플로우 수행 능력을 측정하는 벤치마크. 평가 프레임워크 구축 시 참고.
요약
Accio는 기존 AI 벤치마크의 한계인 '결과물 평가'를 넘어, 실제 실행 역량을 측정하는 'CommerceAgentBench'를 오픈소스로 공개했다. 이 벤치마크는 단순 요약이 아닌 공급업체 검증, 견적 재구성, 통화 정규화, 사기 탐지 및 워크플로우 실행 등 107개의 복합적 실무 과제를 수행해야 한다. 평가는 에이전트가 남긴 운영 흔적(수정 기록, 저장된 초안, 생성된 객체, 실행된 액션)을 기반으로 이루어진다. 해당 벤치마크는 1,000만 명 이상의 SME 사용자 데이터와 200만 건 이상의 대화, 20만 건의 실행 트레이스 등 알리바바의 27년 이커머스 노하우를 바탕으로 설계되었다. 단순한 답변 생성 능력이 아닌, 실제 프로덕션 환경에서 업무가 정확히 완료되었는지를 검증하는 것이 이번 벤치마크의 핵심이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @DataChaz: There is a fundamental problem with most AI benchmarks: They evaluate outputs, while production systems depend on actions. That’s
원문 보기 ↗