← promppy_ 실시간 AI 뉴스
참고Reddit

LLM 하네스 학습(Harness Training)을 통한 에이전트 성능 개선

모델 가중치 대신 프롬프트·도구·컨텍스트 하네스만 튜닝하여 벤치마크 성능을 높이는 방법.

요약

한 개발자가 거대언어모델(LLM)을 고정하고 프롬프트, 도구, 컨텍스트 관리 등을 제어하는 하니스(harness)를 별도로 학습시키는 새로운 방법론을 공개했다. 이 방식은 파이썬 파일 하나로 정의된 하니스가 스스로 변경 사항을 제안하고 성과를 평가하여 최적화하는 구조로 설계되었다. 실험 결과 Qwen 3.6 35B A3B NVFP4 모델로 학습시킨 하니스를 적용했을 때, DeepSeek v3.2, GPT-OSS 20B/120B, MiniMax M2.5 등 4개 모델의 Terminal-Bench 2.0 성능이 향상되었다. 특히 해당 하니스는 기존 공식 Terminus 2 하니스보다 우수한 성능을 기록했다. 개발자는 클라우드 서버의 5090 GPU 환경에서 실험을 진행했으며, 자세한 연구 과정은 블로그를 통해 확인할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 A harness trained on one small model improves Terminal-Bench scores for four others

원문 보기 ↗
다음 뉴스 →

중요Runway, 생성형 미디어 특화 '모델 라우터' API 출시

이미지·영상·오디오 모델을 품질/속도/비용 기준으로 자동 선택. 멀티모델 통합 개발 부담 감소.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스