참고팁Reddit
LLM 하네스 학습(Harness Training)을 통한 에이전트 성능 개선
모델 가중치 대신 프롬프트·도구·컨텍스트 하네스만 튜닝하여 벤치마크 성능을 높이는 방법.
요약
한 개발자가 거대언어모델(LLM)을 고정하고 프롬프트, 도구, 컨텍스트 관리 등을 제어하는 하니스(harness)를 별도로 학습시키는 새로운 방법론을 공개했다. 이 방식은 파이썬 파일 하나로 정의된 하니스가 스스로 변경 사항을 제안하고 성과를 평가하여 최적화하는 구조로 설계되었다. 실험 결과 Qwen 3.6 35B A3B NVFP4 모델로 학습시킨 하니스를 적용했을 때, DeepSeek v3.2, GPT-OSS 20B/120B, MiniMax M2.5 등 4개 모델의 Terminal-Bench 2.0 성능이 향상되었다. 특히 해당 하니스는 기존 공식 Terminus 2 하니스보다 우수한 성능을 기록했다. 개발자는 클라우드 서버의 5090 GPU 환경에서 실험을 진행했으며, 자세한 연구 과정은 블로그를 통해 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 A harness trained on one small model improves Terminal-Bench scores for four others
원문 보기 ↗