NVIDIA 연구: 에이전트 성능의 핵심은 모델이 아닌 '하네스(Scaffolding)'
장기 작업 수행 시 모델 자체보다 메모리·감독 체계를 갖춘 하네스가 성능을 좌우함. 에이전트 설계 시 인프라 투자 중요성 강조.
요약
Nvidia의 최신 연구에 따르면 AI가 장기적이고 복잡한 과제를 수행할 때 모델 자체보다 모델을 제어하는 인프라인 '하니스(harness)'의 역할이 결정적인 것으로 나타났다. 연구진은 메모리 관리와 감독관 역할을 하는 컴포넌트를 결합한 커스텀 하니스를 사용하여 Claude Opus 5 모델로 대화형 추론 벤치마크인 ARC-AGI-3에서 100% 점수를 달성했다. 기존의 하니스 없는 Claude Opus 5의 점수가 30%에 불과했던 점을 고려하면, 에이전트 시스템 성능에서 하니스가 차지하는 비중이 매우 크다는 것을 알 수 있다. Nvidia는 에이전트가 단순히 모델 자체를 의미하는 것이 아니라, 모델을 둘러싼 비계(scaffolding), 런타임, 도구, 라이브러리 등이 결합된 시스템임을 강조했다. 특히 며칠에 걸쳐 수많은 결정을 내리고 작업을 수행해야 하는 장기적 과제에서 이러한 하니스의 중요성은 더욱 부각된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Nvidia just showed that the harness, not the AI model, is now the real hero
원문 보기 ↗