GLM-5.3 Flash('Ox Alpha') 공식 출시, 크기 대비 압도적 벤치마크
320B MoE·활성 18B로 Opus 4.8급 성능에 서빙 비용 1/10, MIT·1M 컨텍스트. 다만 320B 전체 로드 필요.
요약
GLM-5.3 Flash('Ox Alpha')가 공식 발표되었으며, 320B 규모의 MoE 모델임에도 토큰당 18B 파라미터만 활성화하는 뛰어난 효율성을 자랑한다. 성능 면에서 Terminal-Bench 2.1 84.3점, DeepSWE 63.4점, AutomationBench 48.8점을 기록하며 Claude Opus 4.8이나 GPT-5.6 Terra를 앞서는 결과를 보였다. 특히 기존 GLM-5.2 대비 6개 벤치마크 전 항목에서 우위를 점하면서도 서빙 비용은 10분의 1 수준으로 대폭 절감했다. MIT 라이선스로 오픈 웨이트가 공개되었으며, 네이티브 멀티모달 기능과 1M 컨텍스트 윈도우를 지원한다. 활성화 파라미터는 18B이지만 전체 320B 가중치를 저장해야 하므로 로컬 구동 시 이 점을 고려해야 한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: GLM-5.3 Flash ("Ox Alpha") official: Benchmarks attached. This looks exceptional for its size! GLM-5.3-Flash might be one of the m
원문 보기 ↗