소식통: GPT-6 Astra, 10조 파라미터 및 1.2조 활성 파라미터 추정
GPT-6 Astra의 학습 규모와 클러스터 연산량을 기반으로 한 구체적인 분석입니다. 최신 모델의 규모와 학습 효율성을 가늠하는 참고 자료로 가치가 있습니다.
요약
X의 @forloopcodes에 따르면, OpenAI의 차세대 모델인 GPT-6 Astra는 활성 파라미터 약 1.2조 개, 총 파라미터 약 10조~14조 개 규모로 추정된다. GPT-5.5(코드명 Spud)의 사전 학습이 3월 24일 종료된 후, Astra의 사전 학습(코드명 Doug)은 3월 말부터 7월 초까지 약 90~110일간 진행된 것으로 분석된다. 해당 학습에는 Abilene 캠퍼스의 GPU 10만~15만 개가 투입되었으며, 이를 통해 7e26 FLOP 수준의 연산이 수행된 것으로 계산된다. 한편, 8월 25일경 보고된 10조 파라미터 이상의 모델 Bel은 Astra 이후의 모델로 파악된다. 추정되는 파라미터 규모와 최근의 가격 정책을 고려할 때, Astra는 기존 모델 대비 활성 파라미터가 약 1.5~2.5배 증가한 것으로 보인다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @forloopcodes: GPT 6 Astra is estimated to have ~1.2T Active Parameters and ~10T Total Parameters. Reports indicate pre-training for GPT-5.5 (cod
원문 보기 ↗