Hugging Face, 6개월간 진행된 '에이전트 학습' 시리즈 강의 및 코드 공개
에이전트 평가, RL, SFT, 증류 등 실무 에이전트 개발 전 과정을 다룬 고퀄리티 기술 자료.
요약
Hugging Face의 'Training Agents' 시리즈가 6개월간 총 6회의 라이브 세션을 끝으로 마무리되었으며, 누적 조회수 30만 회를 돌파했습니다. 이번 시리즈는 에이전트 평가의 현주소와 벤치마크 점수의 한계를 짚어보는 워크숍을 시작으로, 에이전트를 위한 RL(강화학습), SFT(지도 미세조정), 증류(Distillation) 등 실무적인 핵심 기술을 다뤘습니다. 특히 3회차에서는 TRL과 LoRA를 활용한 에이전트 미세조정을, 5회차에서는 GRPO를 이용한 강화학습과 보상 함수 설계 및 해킹 사례를 실습했습니다. 마지막 세션에서는 OpenEnv 환경을 구축하고 AsyncGRPOTrainer를 통해 실제 코딩 에이전트인 OpenCode를 학습시키는 전 과정을 시연했습니다. 모든 라이브 세션 영상과 코드는 Hugging Face 유튜브 채널과 오픈소스로 공개되어 누구나 학습할 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ben_burtenshaw: We finished the Training Agents series. Six live sessions over six months, from evaluating agents to training them inside real env
원문 보기 ↗