← promppy_ 실시간 AI 뉴스
참고HF Papers

MoE Looped Transformers의 효율적 스케일링 기법 'SMELT' 연구 발표

기존 루프드 트랜스포머의 아키텍처 효율성을 개선한 SMELT 기법 제시. 모델 설계 및 최적화 연구에 참고할 만한 아티팩트.

요약

Looped Transformers는 계층 블록을 반복하여 모델의 실질적인 깊이를 늘리는 방식이지만, 기존 연구들은 FLOPs가 늘어나는 문제를 간과했습니다. 본 연구는 Mixture-of-Experts(MoE) 구조에서 토큰당 FLOPs, 비임베딩 파라미터, KV 캐시를 엄격히 맞춘 SMELT(Sparse MoE Transformer, middle layers Loop Twice)를 제안합니다. SMELT는 중간 계층을 두 번 반복하여 연산 효율을 최적화한 결과, 학습 FLOPs를 6.8~18.0% 절감하면서도 손실값이 더 빠르게 감소하는 성능을 보였습니다. 이러한 효율성은 코드 생성, 긴 문맥 처리, 인컨텍스트 학습 등 하위 벤치마크에서 특히 두드러진 이점을 보입니다. 기계론적 분석에 따르면, 두 번째 반복 과정에서 어텐션 싱크(attention sink) 현상이 줄어들고 관련 토큰에 주의를 집중시키는 유도 편향이 형성되어 성능 향상을 견인합니다. 이번 연구는 예산 제약 상황에서도 계층 반복 기술이 트랜스포머 모델의 성능을 실질적으로 개선할 수 있음을 입증했습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

원문 보기 ↗
다음 뉴스 →

중요Cursor Automations·Cloud Agents 시작 장애 발생, IDE는 정상

클라우드 기반 자동화·에이전트 워크플로 의존 시 작업 지연 가능. 로컬 IDE로 우회 검토.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스