Cerebras, 'CS-4' 공개... 공정 변경 없이 추론 성능 2배 향상
GPT-OSS-120B에서 사용자당 4,400토큰/초. 초저지연 추론이 필요한 서비스라면 GPU 대안으로 검토 가치.
요약
Cerebras가 기존 5nm 공정의 WSE-3 웨이퍼를 유지하면서 AI 추론 성능을 약 2배 향상시킨 CS-4를 공개했습니다. 공정 미세화 대신 전력 공급과 냉각 시스템을 재설계하여 클록 속도를 2배 높이는 방식으로 성능을 끌어올렸습니다. WSE-3 Turbo 기준으로 250 PFLOPs의 AI 연산 성능과 43.2 PB/s의 메모리 대역폭을 제공합니다. CS-4 랙은 웨이퍼 3개를 결합해 총 750 PFLOPs 연산 및 129.6 PB/s 대역폭을 지원합니다. GPT-OSS-120B 모델 실행 시 사용자당 초당 4,400 토큰 이상의 속도를 내며, 이는 기존 GPU 기반 시스템 대비 최대 30배 빠른 추론 속도입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: This is seriously impressive: Cerebras just unveiled CS-4, and nearly doubled its AI inference performance without moving to a new
원문 보기 ↗