참고Hacker News
Qwen 3.8, GPT-5.5 Pro 추론 데이터 학습 정황 포착 (벤치마크 분석)
모델 간 지식 전이 가능성을 시사하는 분석입니다. 특정 모델 채택 시 벤치마크 데이터로 참고하세요.
요약
최신 연구인 'Reasoning prefills' v1.1 실험은 GPT-5.5 Pro를 교사 모델로 활용하여 오픈 모델들의 추론 능력을 측정했다. 연구진은 각 모델의 첫 100개 토큰 내에 교사 모델의 답변이 얼마나 포함되는지를 측정해 학습 여부를 분석했으며, 평가에는 STEM, 비-STEM, 합성 퍼즐 등 45개 문제가 활용되었다. 실험 결과 Qwen은 이전 Opus 4.8 대비 GPT-5.5 Pro 모델을 향해 18.18포인트 상승한 수치를 보이며, 데이터상 Opus보다 GPT-5.5 Pro나 유사 모델로 학습되었을 가능성이 제기되었다. 반면 Kimi K3는 프리필(prefill) 적용 여부와 관계없이 GPT-5.5 Pro와 가장 높은 중첩률을 기록했으나, 프리필에 의한 상승폭은 +4.54포인트에 그쳤다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen 3.8 follows GPT-5.5 Pro reasoning prefills
원문 보기 ↗