← promppy_ 실시간 AI 뉴스
참고X

Looped Transformer 아키텍처: 차세대 AI 모델의 효율성 핵심

층을 반복 실행해 컴퓨팅 효율을 높이는 Looped Transformer가 차세대 모델의 구조적 표준이 될 가능성 제시.

요약

최근 공개된 연구에 따르면, 오픈AI의 차세대 모델인 Astra나 GPT-6에 Looped Transformer 아키텍처가 적용될 가능성이 제기되고 있다. 칭화대, 바이트댄스 Seed, TokenWave 연구진이 개발한 MoE Looped Transformer 모델 'SMELT'는 중간 레이어를 두 번 통과시키는 구조를 갖췄다. SMELT는 동일한 연산량(FLOPs), 파라미터 수, KV 캐시 조건에서 기존 트랜스포머 모델보다 6.8~18% 적은 학습 연산량으로 목표 손실값에 도달했다. 특히 코딩 작업에서는 20.4%의 효율성 향상을 보였으며, 시퀀스가 길어질수록 성능 개선 폭이 더 커지는 특성을 확인했다. 핵심은 두 번째 연산 과정에서 불필요한 '어텐션 싱크' 토큰이 아닌 유의미한 콘텐츠에 집중함으로써 정보가 정교화된다는 점이다. 업계에서는 이 루핑(Looping) 기술이 차세대 프론티어 모델의 핵심 구조 변화를 이끌 것으로 주목하고 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @mark_k: Looped Transformers are about to become a VERY big deal! @OpenAI's imminent Astra / GPT-6 is reportedly based on this architecture

원문 보기 ↗
다음 뉴스 →

중요OpenAI, 차세대 'Astra'에 순환 추론 도입…작은 모델로 깊은 사고, 안전성은 숙제

같은 신경망 반복 활용으로 소형 모델도 복잡 작업 가능. 단 내부 계산 블랙박스화로 모니터링 난이도 상승

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스