DeepSeek V4 Flash 성능 벤치마크: 에이전트 프레임워크별 승률 비교
Claude Code, Codex 등 4개 프레임워크에서의 에이전트 수행 성능 분석. 특정 작업에서 프레임워크 선택의 중요성을 시사함.
요약
Composio가 30개의 에이전트 태스크를 대상으로 DeepSeek V4 Flash를 4개 에이전트 하네스(Claude Code, Codex, OpenCode, Oh My Pi)에서 테스트한 결과를 공개했다. 테스트 결과, 성공률, 비용, 속도 등 각 지표별로 가장 뛰어난 하네스가 모두 다르게 나타났다. 30개 태스크 기준 성공률은 Oh My Pi가 17개로 가장 높았고, Claude Code와 Codex가 각 16개, OpenCode가 14개를 기록했다. 특히 7개의 태스크는 어떤 하네스를 사용하느냐에 따라 성공 여부가 갈리는 모습을 보였다. 이번 실험은 동일한 모델이라도 에이전트 프레임워크나 하네스 선택이 실제 에이전트 성능에 큰 영향을 미칠 수 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @composio: We ran DeepSeek V4 Flash through 4 agent harnesses (Claude Code, Codex, OpenCode, Oh My Pi) on 30 agentic tasks. A different harne
원문 보기 ↗