참고팁X
Nathan Lambert의 RLHF 가이드북 및 실습 강의 자료 공개
모델 튜닝과 정렬의 핵심인 RLHF를 이론부터 실습 코드까지 체계적으로 학습할 수 있는 실무 자료.
요약
AI 연구자 Nat Lambert가 'Reinforcement Learning from Human Feedback' 책을 출간했다. 2024년부터 밤과 주말 시간을 활용해 집필한 이 책은 모델 파인튜닝, 정렬(align), 포스트 트레이닝의 기초를 다루며 Olmo 개발 경험을 녹여냈다. 도서와 함께 10시간 이상의 강의, 슬라이드 덱, 실습 코드, 예제 모델 완성 라이브러리 등이 포함된 풀 코스가 제공된다. 온라인 웹 버전은 무료로 이용할 수 있으며, 물리적인 서적은 Manning을 통해 1~2주 내, 아마존에서는 그 이후 배송될 예정이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @natolambert: My book, Reinforcement Learning from Human Feedback is done! This is the book I wish I had when learning to fine-tune, align, & no
원문 보기 ↗