DeepSeek V4 Flash, 에이전트 프레임워크 4종 벤치마크 결과
에이전트 구현 시 각 프레임워크별 성공률과 비용 효율성 데이터를 참고할 수 있음.
요약
Composio가 DeepSeek V4 Flash를 4개의 새로운 에이전트 하네스(Hermes Agent, Pi Agent, Prime Agent, Deep Agents)에 적용하여 30개의 난도 높은 에이전트 작업에 대한 성능을 테스트했다. 테스트 결과, Pi Agent가 30개 과제 중 20개를 통과하며 가장 우수한 성적을 거두었고 비용 효율성 면에서도 가장 뛰어났다. 이어 Deep Agents(LangChain 개발)는 16개, Hermes Agent는 15개, Prime Agent는 24개 유효 실행 중 15개를 통과했다. 이번 결과는 기존에 테스트한 4개 하네스(Codex, Claude Code, OpenCode, OMP)를 포함해 총 8개 하네스에 대한 전체 비교 데이터를 제공한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @composio: We ran DeepSeek V4 Flash through 4 more agent harnesses (Hermes Agent, Pi Agent, Prime Agent, Deep Agents) on 30 challenging agent
원문 보기 ↗