Hugging Face, Claude Code·Codex 등 코딩 하네스를 수정 없이 RL 환경으로 전환하는 오픈소스 프록시 공개
하네스 재구현 없이 실제 배포 환경에서 모델을 RL 학습 가능. 동일 모델도 하네스별 성능차 커 검증 필요.
요약
Clement Delangue는 Claude Code, Codex, Hermes, Pi, @opencode 등 다양한 코딩 도구를 RL 환경으로 변환하는 오픈소스 프레임워크를 공개했다. 이 방식은 기존 코딩 도구를 수정하지 않고, 캡처 프록시를 통해 모델 API인 것처럼 속여 vLLM으로 트래픽을 전달하고 토큰 데이터를 기록하는 구조를 취한다. 특히 이 환경을 통해 과제 해결 시 도구 호출 수를 줄이는 보상을 설정하자, 기존 대비 도구 호출이 31% 감소하는 등 모델의 효율성이 크게 향상되었다. Liquid AI의 LFM2.5-2.6B 모델로 실험한 결과, 여러 환경에서 동시 학습시킬 경우 성능이 전반적으로 개선되었으며 이는 기존 SFT 방식보다 우수한 결과를 보였다. 현재 OpenEnv의 캡처 프록시, TRL의 트레이너, 7개의 학습 모델 등이 모두 공개되어 재현 가능하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ClementDelangue: We turned Claude Code, Codex, Hermes, Pi, @opencode and other coding harnesses into RL environments. No changes to the harnesses,
원문 보기 ↗