참고AI타임스
퍼플렉시티, 연구 에이전트 성능 평가 벤치마크 ‘WANDR’ 공개
최신 연구 에이전트들이 실제 리서치 업무 수행 시 겪는 한계점과 정확도를 측정하는 지표로 활용 가능.
요약
퍼플렉시티는 14일(현지시간) AI 연구 에이전트의 실무 수행 능력을 평가하기 위한 새로운 오픈 벤치마크 'WANDR(Wide ANd Deep Research)'를 출시했다. 현재 AI 연구 에이전트는 경쟁사 분석이나 시장조사 등 실제 업무에 도입되고 있으나, 방대한 정보를 빠짐없이 수집하고 신뢰할 수 있는 근거로 입증하는 능력은 여전히 부족한 실정이다. 퍼플렉시티는 이번 벤치마크를 통해 테스트한 결과, 현재 최고 성능의 AI 시스템조차 완전한 리서치를 수행하기에는 상당한 한계가 있다는 점을 확인했다. 이번 공개는 AI 모델의 지식 노동 수행 능력을 객관적으로 측정하여 기술적 한계를 극복하기 위한 시도로 풀이된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 퍼플렉시티, 연구 에이전트 벤치마크 'WANDR' 출시…"최고 AI도 실무는 한계"
원문 보기 ↗