"단어 예측 아닌 개념 예측(NCP)으로 효율 극대화"…새로운 아키텍처 연구 등장
기존 LLM의 Next-Token Prediction을 대체할 NCP 방식 제안, 적은 학습 데이터로 높은 성능 확보 가능성 시사.
요약
중국 상하이 연구팀이 기존의 Next-Token Prediction 방식에서 벗어나 개념 단위로 사고하는 새로운 모델 'NCP-ArchPreview'와 관련 논문을 공개했다. 이 모델은 8.9B 파라미터 규모로, 단어 단위가 아닌 잠재 공간에서 정보를 그룹화한 'Next Concept Prediction(NCP)' 방식을 채택했다. 해당 방식은 기존 SOTA 모델 대비 51.3%의 학습 데이터만으로 동일한 지능 수준에 도달했으며, 학습 토큰 수를 절반으로 줄이고도 완전 수렴을 달성했다. 특히 복잡한 수학 및 추론 영역에서 기존 모델 대비 6점 높은 성능을 기록했으며, 표준 컴퓨팅 자원 소모량도 15% 절감하는 효율을 보였다. 이번 연구는 AI가 단순히 다음 단어를 예측하는 수준을 넘어 개념을 이해하는 방향으로 학습 패러다임이 전환될 수 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @HowToPrompt__: China just published a paper that might end the current LLM era. They open-sourced NCP-ArchPreview, an 8.9B model that thinks in c
원문 보기 ↗