NVIDIA(엔비디아), 에이전트 신뢰성 높이는 '체크포인트 검증' 하네스 구조 공개
에이전트가 명령어 실행 전 여러 버전을 생성하고 검증기가 최적의 명령을 선택하는 방식. 에이전트 구축 시 실질적인 성능 향상 팁.
요약
NVIDIA는 터미널 에이전트의 안정성을 높이기 위해 매 단계마다 검증 과정을 거치는 새로운 하네스(Harness) 설정을 공개했다. 기존 에이전트는 한 번에 하나의 명령만 실행했으나, 이 방식은 에이전트가 다음 명령 8개 버전을 생성하면 별도의 검증기가 그중 하나를 선택해 실행하는 구조다. 검증기는 에이전트의 추론 과정이 아닌 작업과 기록만을 보고 명령을 판단하며, 순위 지정, 개별 점수 산정, 쌍 비교 등 3가지 방식을 지원한다. 특히 비용 효율성을 위해 쌍 비교 모드에서 이유를 제외하고 A/B 선택만 요청하거나 작은 모델을 검증기로 활용할 수 있다. 이번 연구의 핵심은 더 많은 선택지를 제공하는 것보다 더 나은 검증기를 사용하는 것이 에이전트 성능 향상에 효과적이라는 점이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @undefinedKi: This might be the most practical harness paper this year NVIDIA just shared its own harness setup for terminal agents. Normal agen
원문 보기 ↗