Zhipu, GLM-5.3이 직접 자사 추론 인프라 최적화…국산 가속기 10만장에서 처리량 3배
모델이 자기 추론 시스템을 튜닝해 커널 버그·병목 해결. AI 인프라 엔지니어링 자동화의 실전 검증 사례.
요약
중국의 AI 기업 Zhipu의 최신 모델 GLM-5.3이 스스로 자사의 추론 시스템을 최적화하고 구축하는 성과를 거뒀다. 해당 모델은 10만 개 이상의 중국산 AI 가속기를 활용하여 제약이 많은 환경 속에서도 Infra Agent를 통해 커널 버그를 수정하고 동시성 병목 현상을 해결했다. 이러한 엔지니어링 작업은 단 2주 만에 프로덕션 환경으로 전환되었으며, 결과적으로 추론 처리량(throughput)이 3배 증가했다. 이후 'Ox-Alpha'라는 가명으로 OpenCode와 OpenRouter에 배포된 이 모델은 공개 6일 만에 두 플랫폼에서 가장 많이 사용되는 모델로 등극했다. 현재까지 62조 개의 토큰을 처리한 Zhipu는 이를 통해 완전한 재귀적 자기 개선 단계에는 도달하지 않았으나, 관련 기술 진보가 가속화되고 있음을 확인했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @VaibhavSisinty: What happens when your AI model becomes good enough to build its own infrastructure? Zhipu just found out. Their AI model GLM-5.3
원문 보기 ↗