← promppy_ 실시간 AI 뉴스
참고X

자연어 기반 RL 학습 평가 모델 'RULER' 활용법

보상 함수를 코딩 대신 자연어로 기술해 학습시키는 방법. 에이전트 미세 조정 시 보상 설계의 복잡도 해소.

요약

강화학습(RL)에서 단순한 보상 수치만으로는 에이전트의 복잡한 의사결정 과정을 평가하기 어렵다는 안드레이 카파시(Karpathy)의 예측이 현실화되고 있다. 오픈파이프(OpenPipe)의 ART(Automated Reinforcement Learning Training) 프레임워크에 구현된 RULER는 엔지니어가 평범한 영어로 평가 기준을 작성하면 LLM이 이를 바탕으로 여러 작업 궤적을 검토하고 순위를 매기는 방식을 제공한다. ART는 이 비교 결과를 GRPO 학습을 위한 보상 수치로 변환하며, 사용자는 평가 기준을 자연어로 수정하여 에이전트의 행동을 유연하게 개선할 수 있다. 실제 이를 활용해 Qwen3 1.4B 모델을 2048 게임 에이전트로 학습시킨 결과, 코드 기반의 규칙 없이도 정교한 평가가 가능함을 입증했다. 전체 구현 코드는 ART 깃허브 저장소를 통해 확인할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @_avichawla: Karpathy's prediction about RL is coming true now! He argued that a single reward number tells an agent very little about why its

원문 보기 ↗

광고

다음 뉴스 →

중요EU, 주요 AI 연구소 초청해 'AI 개발 속도 조절' 회동 추진

AI법에 이어 프런티어 모델 규제 압박 강화. EU 시장 진출 서비스는 규제 리스크 점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스