← promppy_ 실시간 AI 뉴스
참고HF Papers

복합 스킬 전환 능력 측정 'Skill^2-Bench' 및 Skill-Entropy RL 학습법

LLM의 긴 호흡 추론 시 스킬 전환 능력이 핵심. 이 전환 난이도를 벤치마크하고 RL 학습에 활용하는 방법론 제안.

요약

최근 LLM의 장기 추론 능력 향상을 위해 서로 다른 추론 기술 간의 전환을 평가하고 학습시키는 Skill-Entropy 개념이 제안되었습니다. 연구팀은 9개 영역, 558개 기술을 바탕으로 기술 전환 난이도를 측정하는 Skill^2-Bench 벤치마크를 구축하여 기존 모델들이 높은 엔트로피 작업에서 성능 저하를 보이는 '기술 전환 격차'를 확인했습니다. 이를 해결하기 위해 모델이 추론 단계별로 사용할 기술을 예측하게 하고, 정답률과 기술 예측 정확도를 보상으로 활용하는 Skill-Entropy RL 프레임워크를 개발했습니다. 실험 결과, Qwen3-4B-Instruct와 Qwen3-1.7B 모델에 이 방식을 적용했을 때 Skill^2-Bench 점수가 각각 34.4%에서 68.4%, 14.6%에서 40.1%로 대폭 향상되었습니다. 이 파이프라인은 OpenR1-Math와 같은 기존 학습 데이터에도 범용적으로 적용할 수 있어 실무적인 활용 가능성을 입증했습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

원문 보기 ↗
다음 뉴스 →

중요Claude 대화, 삭제해도 최대 5년간 학습용으로 보관될 수 있어

'Help Improve Claude'가 기본 활성화. 민감 데이터 다룬다면 설정에서 즉시 끄고 확인 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스