사전 학습 비용 절반으로 줄인 'NCP-ArchPreview' 모델 아키텍처 공개
토큰 단위가 아닌 개념 단위 예측으로 사전 학습 효율 2배 개선. 고성능 모델 개발의 비용 혁신 기대.
요약
8.9B 파라미터 규모의 잠재 공간(latent-space) 언어 모델인 NCP-ArchPreview는 다음 토큰 예측을 넘어 여러 토큰에 걸친 이산적 개념을 학습하고 이를 다시 토큰 생성에 반영하는 새로운 AI 아키텍처를 도입했다. 연구진에 따르면, 이 모델은 OLMo-3-7B와 동일한 사전 학습 손실(pretraining loss)을 달성하는 데 전체 학습 토큰의 51.3%만 사용했다. 또한 GSM8K 벤치마크에서 +5.99점을 기록하는 등 하위 벤치마크 전반에서 2.45점 앞선 성능을 보였다. 이번 결과가 확장성을 입증할 경우, 차세대 개념 예측(Next Concept Prediction) 방식은 대규모 모델 학습의 경제성을 크게 바꿀 것으로 예상된다. 현재 해당 모델의 가중치, 학습 레시피, 체크포인트는 모두 공개된 상태다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @mark_k: A new AI architecture may have just cut pretraining almost in half. NCP-ArchPreview is an 8.9B-parameter latent-space language mod
원문 보기 ↗