DeepSeek-V4-Pro용 'J-Space' 하네스 공개, 에이전트 성능 향상
J-Space 적용 시 터미널 및 코딩 벤치마크 점수 유의미하게 상승. DeepSeek 활용 중인 개발자는 검토 권장.
요약
DeepSeek V4 Pro 0813 모델과 J-Space 하네스(harness)를 결합한 새로운 방식이 확장된 추론 및 도구 사용 과정에서의 오류를 줄이는 효과를 보였다. 주요 벤치마크 테스트 결과, Terminal Bench는 87.9에서 90.1로, NL2Repo는 61.5에서 73.4로 성능이 크게 향상되었다. 또한 CyberGym 86.8, DeepSWE 72.0, Toolathlon 79.5 등 전반적인 지표에서 유의미한 개선이 확인되었다. 이 조합은 에이전트 및 코딩 관련 벤치마크에서 Fable 5와 Opus 4.8보다 뛰어난 성능을 기록했다. 이번 결과는 특정 하네스 도입을 통해 기존 대규모 언어 모델의 실무적 도구 활용 능력을 보완할 수 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: Someone has combined DeepSeek V4 Pro 0813 with a harness called J-Space, which apparently reduces errors in the extended reasoning
원문 보기 ↗