NVIDIA, Groq 3 LPX 정식 양산… Vera Rubin으로 에이전트 추론 확장
10만 토큰 장문맥에서 초당 3,400토큰·경쟁 대비 4배. 에이전트 서비스 인프라 재검토 필요.
요약
NVIDIA는 에이전트 시스템에 최적화된 'NVIDIA Vera Rubin NVL72'의 빠른 토큰 생성 기능을 발표하며 'NVIDIA Groq 3 LPX'의 본격적인 양산에 돌입했다. Artificial Analysis의 Gemma 4 31B 벤치마크 결과, NVIDIA Groq 3 LPX는 10만 토큰의 긴 문맥 처리 환경에서 초당 3,400개의 출력 토큰을 생성하며 경쟁 플랫폼 대비 4배 빠른 성능을 기록했다. SpaceXAI는 차세대 에이전트 AI 구동을 위해 NVIDIA Vera CPU 도입을 확정했으며, Nebius는 NVIDIA Groq 3 LPX를 채택한 첫 번째 AI 클라우드 기업이 되었다. 또한 CoreWeave는 NVIDIA Vera Rubin 랙을 연결해 고대역폭 네트워크를 제공하는 'Spectrum-X Multiplane'을 생산 환경에 배포했다. AI 산업의 중심이 학습에서 추론과 에이전트 영역으로 이동함에 따라, NVIDIA는 처리량과 반응성, 경제성을 모두 갖춘 인프라 솔루션을 통해 차세대 AI 경쟁력을 강화하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents
원문 보기 ↗