Qwengram-0.8B: n-gram 메모리 전이로 소형 모델 성능 개선 기술
소형 언어 모델의 추론 성능을 추가 학습 없이 파라미터 메모리 전이만으로 개선하는 최적화 기법.
요약
최근 한 개발자가 Qwen3.8 Flash-Next의 PLE n-gram 메모리를 Qwen3.5-0.8B 모델에 이식한 'Qwengram-0.8B'를 선보였다. 이 실험은 대규모 언어 모델의 메모리를 소형 모델에 활용할 가능성을 입증하기 위해 진행되었으며, 백본 파인튜닝 없이도 성능 향상을 끌어냈다. 구체적으로는 Qwen3.5-0.8B의 백본과 약 51B 파라미터 규모의 PLE 메모리를 고정한 채, 디코더 3번과 9번 레이어에 작은 R=1 리더를 학습시키는 방식을 사용했다. 그 결과, 기존 Qwen3.5-0.8B의 검증 데이터셋 PPL은 18.2759였으나, Qwengram-0.8B는 17.3534로 측정되어 5.05%의 성능 개선 효과를 보였다. 이번 결과는 제한된 컴퓨팅 자원을 활용해 소형 모델의 추론 성능을 최적화할 수 있는 효율적인 기술적 접근법을 제시한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwengram-0.8B: I transferred Qwen3.8 Flash-Next’s n-gram memory into Qwen3.5-0.8B — 5.05% lower validation perplexity
원문 보기 ↗