← promppy_ 실시간 AI 뉴스
참고AI타임스

퍼플렉시티, 연구 에이전트 성능 평가 벤치마크 ‘WANDR’ 공개

최신 연구 에이전트들이 실제 리서치 업무 수행 시 겪는 한계점과 정확도를 측정하는 지표로 활용 가능.

요약

퍼플렉시티는 14일(현지시간) AI 연구 에이전트의 실무 수행 능력을 평가하기 위한 새로운 오픈 벤치마크 'WANDR(Wide ANd Deep Research)'를 출시했다. 현재 AI 연구 에이전트는 경쟁사 분석이나 시장조사 등 실제 업무에 도입되고 있으나, 방대한 정보를 빠짐없이 수집하고 신뢰할 수 있는 근거로 입증하는 능력은 여전히 부족한 실정이다. 퍼플렉시티는 이번 벤치마크를 통해 테스트한 결과, 현재 최고 성능의 AI 시스템조차 완전한 리서치를 수행하기에는 상당한 한계가 있다는 점을 확인했다. 이번 공개는 AI 모델의 지식 노동 수행 능력을 객관적으로 측정하여 기술적 한계를 극복하기 위한 시도로 풀이된다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 퍼플렉시티, 연구 에이전트 벤치마크 'WANDR' 출시…"최고 AI도 실무는 한계"

원문 보기 ↗

광고

다음 뉴스 →

중요미국 정부, "AI 속도 우려 기업은 스스로 멈춰라"… 강제 규제엔 선 긋기

미 규제 개입 최소화 기조 재확인. AI 안전·거버넌스는 당분간 기업 자율에 맡겨질 전망.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스