Hugging Face, 동일 모델도 하네스에 따라 점수 62% vs 33%…'멀티 하네스 RL' 가이드 공개
Claude Code·Codex 코드 수정 없이 프록시로 토큰·logprob 캡처해 학습. 에이전트 RL 실무에 바로 적용 가능.
요약
Hugging Face는 동일한 모델이라도 평가 도구(harness)에 따라 성능 점수가 극명하게 갈리는 문제를 해결하기 위해 '멀티-harness RL' 가이드를 공개했다. 핵심 기법은 모델을 직접 수정하는 대신 프록시(proxy)를 활용해 OpenAI, Anthropic, Gemini 등 4가지 API 형식을 모두 지원하고 vLLM이 샘플링한 토큰 ID와 로그 확률을 기록하여 학습하는 방식이다. Liquid AI의 LFM2.5-2.6B 모델을 이 방식으로 4개 harness에서 동시 학습시킨 결과, 성능은 42%에서 54%로 향상되었고 도구 호출 횟수는 31% 감소했다. 반면 Qwen3.8-27B의 성공 사례를 모방 학습(Imitation)했을 때는 성능이 47.5%에 머물러 강화학습(RL) 방식이 더 우수함을 입증했다. 관련 학습 코드, 데이터, 트레이너, 프록시 등 모든 자료는 오픈 소스로 공개되어 누구나 다양한 harness 환경에 맞춰 모델을 학습시킬 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @huggingface: The same model, with the same weights, scores 62% in one agent harness and 33% in another. @adithya_s_k and the @huggingface team
원문 보기 ↗