Nebius 첫 도입·SpaceXAI Vera CPU 채택

Spectrum-X, GPU 51만2,000개까지 연결 지원

핵심 요약

  • NVIDIA는 8월 24일 NVIDIA Groq 3 LPX가 양산 단계에 들어갔으며 10만 토큰 맥락에서 초당 3,400개의 출력 토큰을 생성했다고 밝혔다.
  • Nebius는 8월 24일 NVIDIA Groq 3 LPX를 도입하는 첫 AI 클라우드 사업자로 발표됐다.
  • CoreWeave는 8월 24일 GPU 51만2,000개까지 연결하도록 설계된 Spectrum-X Multiplane을 실제 서비스 환경에 배치했다고 밝혔다.

NVIDIA는 8월 24일 에이전틱 AI용 랙 스케일 추론 시스템 NVIDIA Groq 3 LPX가 양산 단계에 들어갔다고 밝혔다. NVIDIA에 따르면 이 시스템은 Gemma 4 31B를 구동한 Artificial Analysis 벤치마크에서 10만 토큰 장문 맥락 기준 초당 3,400개의 출력 토큰을 생성해 가장 가까운 대안 플랫폼보다 4배 빠른 성능을 냈다.

NVIDIA Groq 3 LPX는 Vera Rubin NVL72와 함께 작동하며 지연에 민감한 디코드 작업을 가속하는 추론 아키텍처다. Rubin GPU가 대규모 맥락 처리를 맡고 LPX가 토큰 생성을 담당해 에이전트의 추론과 상호작용 응답 속도를 높이는 구조다.

NVIDIA는 AI 작업의 중심이 학습에서 추론과 에이전틱 시스템으로 옮겨가면서 처리해야 할 맥락과 생성 토큰이 늘고 있다고 설명했다. 회사는 이번 주 미국 캘리포니아주 팰로앨토에서 열린 Hot Chips에서 연산·네트워킹·추론 가속을 하나의 AI 팩토리로 설계하는 구성을 공개했다.

NVIDIA Groq 3 LPX는 Vera Rubin NVL72에 특화된 토큰 생성 가속 기능을 더한다. Rubin GPU와 LPU가 AI 모델의 각 계층을 함께 계산하며, 랙 스케일 구성에는 칩 간 직접 연결을 적용한 LP30 가속기 256개를 탑재할 수 있다. NVIDIA는 대규모 LPU 집합이 결정론적 추론에 최적화된 하나의 프로세서처럼 작동한다고 밝혔다.

Nebius는 NVIDIA Groq 3 LPX를 도입하는 첫 AI 클라우드 사업자로 이름을 올렸다. Nebius Token Factory에 Vera Rubin NVL72와 NVIDIA Groq 3 LPX를 결합해 대화형 에이전트와 코딩 시스템 등 실시간 AI 서비스를 지원할 방침이다.

SpaceXAI는 지상 데이터센터부터 궤도 위성까지 미래 AI 아키텍처를 NVIDIA Vera Rubin 중심으로 구축·확장할 계획이다. NVIDIA Vera CPU는 오케스트레이션, 도구 사용, 코드 실행, 데이터 처리와 시뮬레이션 등 에이전틱 AI의 CPU 집약 작업을 가속하는 데 쓰일 예정이다.

CoreWeave는 여러 병렬 스위치로 NVIDIA Vera Rubin 랙을 연결하는 Spectrum-X Multiplane을 실제 서비스 환경에 배치했다. 이 기술은 서버의 네트워크 연결을 여러 독립 경로인 ‘플레인’으로 나누고 각 경로에 2계층 네트워크를 적용해 별도의 3계층 없이 GPU 51만2,000개까지 확장하도록 설계됐다.

NVIDIA ConnectX SuperNIC 내부의 전용 하드웨어 엔진은 플레인 사이 트래픽을 관리하고 장애가 발생하면 경로를 자동 전환한다. NVIDIA에 따르면 8개 플레인 구성에서 하나가 고장 나도 전체 대역폭의 약 90%를 유지하며, 하드웨어 복구 속도는 소프트웨어 기반 멀티플레인 부하 분산보다 11배 빠르다. 회사는 이 구성이 AI 팩토리 산출량을 1.6배 높인다고 설명했다.

Spectrum-X Ethernet은 스위치와 SuperNIC, 소프트웨어를 묶은 AI용 이더넷 플랫폼이다. NVIDIA는 범용 이더넷보다 AI 네트워킹 성능을 1.6배 높이도록 설계했다고 밝혔다.

Vera Rubin NVL72용 Spectrum-X SN6000 시리즈 스위치는 102.4Tb/s Spectrum-6 Ethernet ASIC과 ConnectX-9 SuperNIC을 기반으로 GPU당 최대 1,600Gb/s를 지원한다. Spectrum-XGS Ethernet은 여러 데이터센터를 하나의 AI 슈퍼팩토리처럼 연결하며, NVIDIA에 따르면 다중 사이트 NCCL 집합 통신을 1.9배 가속한다.

NVIDIA는 BlueField-4 프로세서와 DOCA 소프트웨어 플랫폼을 기반으로 한 NVIDIA Scale-In도 선보였다. NVIDIA AI 네트워킹의 다섯 번째 축으로 소개된 Scale-In은 기존의 노스-사우스 접속망을 Spectrum-X Ethernet으로 연결된 통합 가속 인프라 영역으로 전환해 AI 팩토리의 네트워킹·스토리지·사이버보안·운영 서비스를 지원한다.

NVIDIA는 에이전틱 AI가 다른 AI 시스템 및 여러 데이터 소스와 상호작용하면서 빠른 추론 수요가 커진다고 봤다. 이에 따라 토큰 생성 속도뿐 아니라 처리량, 응답성, 인프라 활용도를 함께 높이는 ‘토큰 팩토리’ 구성을 Vera Rubin 플랫폼 전반으로 확대하고 있다.

인공지능(AI)과 스타트업 분야의 주요 소식을 전합니다.