복합 스킬 전환 능력 측정 'Skill^2-Bench' 및 Skill-Entropy RL 학습법
LLM의 긴 호흡 추론 시 스킬 전환 능력이 핵심. 이 전환 난이도를 벤치마크하고 RL 학습에 활용하는 방법론 제안.
요약
최근 LLM의 장기 추론 능력 향상을 위해 서로 다른 추론 기술 간의 전환을 평가하고 학습시키는 Skill-Entropy 개념이 제안되었습니다. 연구팀은 9개 영역, 558개 기술을 바탕으로 기술 전환 난이도를 측정하는 Skill^2-Bench 벤치마크를 구축하여 기존 모델들이 높은 엔트로피 작업에서 성능 저하를 보이는 '기술 전환 격차'를 확인했습니다. 이를 해결하기 위해 모델이 추론 단계별로 사용할 기술을 예측하게 하고, 정답률과 기술 예측 정확도를 보상으로 활용하는 Skill-Entropy RL 프레임워크를 개발했습니다. 실험 결과, Qwen3-4B-Instruct와 Qwen3-1.7B 모델에 이 방식을 적용했을 때 Skill^2-Bench 점수가 각각 34.4%에서 68.4%, 14.6%에서 40.1%로 대폭 향상되었습니다. 이 파이프라인은 OpenR1-Math와 같은 기존 학습 데이터에도 범용적으로 적용할 수 있어 실무적인 활용 가능성을 입증했습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
원문 보기 ↗