6세대 NVLink, 72개 XPU 연결 지연 3분의 1

NVLink-C2C, PCIe 대비 에너지 효율 6배 달성

핵심 요약

  • NVIDIA는 8월 24일 NVLink Fusion의 6세대 NVLink가 72개 XPU 규모의 스케일업 도메인을 지원한다고 밝혔다.
  • NVIDIA는 8월 24일 XPU 간 전송 지연이 범용 이더넷 기반 대안의 3분의 1이고 패킷 처리율은 10배라고 설명했다.
  • NVIDIA는 8월 24일 NVLink-C2C가 PCIe 인터페이스 대비 최대 6배 높은 에너지 효율을 제공한다고 밝혔다.

NVIDIA는 8월 24일 맞춤형 XPU를 자사 AI 인프라에 연결하는 NVLink Fusion이 6세대 NVLink를 통해 72개 XPU 규모의 스케일업 도메인을 지원한다고 밝혔다. NVIDIA에 따르면 이 구성의 XPU 간 전송 종단 지연은 범용 이더넷 기반 대안의 3분의 1이고 패킷 처리율은 10배다.

NVLink Fusion은 하이퍼스케일러와 AI 전문 기업이 자체 XPU를 개발하면서 NVIDIA의 네트워크, 랙 구조, 생산 소프트웨어와 공급망을 결합하도록 설계한 반맞춤형 AI 팩토리 플랫폼이다. 기업은 가속기 설계에 집중하고 데이터센터 배치에 필요한 나머지 인프라는 검증된 기술로 구성할 수 있다.

AI 팩토리의 경제성은 초당 토큰, 와트당 토큰, 토큰당 비용, 가동률과 가동 시간에 좌우된다. 조 단위 매개변수 모델, 전문가 혼합(MoE) 구조와 에이전틱 AI를 운용할 때 스케일업 패브릭 성능이 부족하면 가속기 활용률이 낮아지고 토큰당 비용이 올라간다.

6세대 NVLink는 72개 XPU 영역에 고대역폭·저지연 연결을 제공한다. NVIDIA는 향후 NVLink 로드맵에 최대 1,152개 가속기 도메인과 공동 패키징 광학 기술을 포함한다고 설명했다.

NVIDIA GB300 NVL72는 72개 GPU로 구성된 NVLink 스케일업 도메인을 이용해 NVIDIA B300보다 GPU당 처리량과 상호작용 성능을 높인다. NVIDIA의 AI 추론 성능 벤치마크 결과에 따르면 NVL72를 쓰지 않는 구성과 비교해 종단 처리량과 상호작용 성능도 크게 향상된다.

NVLink Fusion에는 XPU를 NVIDIA Vera CPU 또는 생태계의 다른 CPU와 잇는 NVIDIA NVLink-C2C도 포함된다. NVIDIA는 NVLink-C2C가 PCIe 인터페이스보다 최대 6배 높은 에너지 효율을 제공해 에이전틱 시스템의 제어와 연산 사이 장벽을 줄인다고 밝혔다.

맞춤형 XPU의 데이터센터 투입에는 고속 CPU·스케일업 인터페이스 통합, 스케일업 네트워크 조달과 검증, 컴퓨트·스위치 트레이 설계가 필요하다. 냉각·전력을 포함한 랙 구조 검증, 보안·스토리지 통합과 복잡한 공급망 관리도 뒤따른다.

NVLink Fusion 생태계에는 ASIC 설계, CPU, IP와 광 인터커넥트 협력사가 참여한다. 팀 윌슨 Intel 데이터센터 실리콘 엔지니어링 부사장 겸 총괄은 “NVLink Fusion은 고객이 관심 있는 워크로드 요구에 가장 잘 맞는 CPU 아키텍처, 성능 수준, 소프트웨어 기능을 선택할 수 있게 한다”고 말했다.

도입 기업은 NVIDIA MGX 랙 규모 아키텍처와 NVIDIA Vera Rubin NVL72 같은 MGX 기반 시스템의 공급망을 함께 이용할 수 있다. 제조 협력사가 설계와 통합을 맡고 MGX 공급사는 랙, 냉각, 전력, 신규 800 VDC 설계에 필요한 구성 요소를 제공한다.

잭 루오 QCT·Quanta Computer 제품·솔루션 책임자는 “Vera Rubin NVL72의 제조 라인에서는 시스템 조립의 거의 100% 자동화를 검토하고 있다”며 “XPU가 NVLink Fusion을 활용하면 이들 투자의 대부분을 활용할 수 있다”고 밝혔다.

AI 팩토리 건설 계획은 최종 가속기 구성이 확정되기 전부터 전력 조달, 시설 설계, 냉각, 랙 배치와 네트워크 설계를 진행해야 한다. NVLink Fusion은 XPU 기반 시스템과 Vera Rubin NVL72 같은 GPU 기반 시스템이 랙 공간, 네트워크, 냉각, 전력 공급과 관리 체계를 공유하도록 해 운영자가 먼저 시설을 구축한 뒤 워크로드 수요와 칩 공급, 사업 우선순위에 맞춰 용량을 다시 배정할 수 있게 한다.

빈스 후 MediaTek 데이터센터·컴퓨팅 사업그룹 수석부사장 겸 총괄은 “고객은 NVIDIA GPU로 랙 수준 솔루션을 배치한 뒤 XPU 개발을 분리해 다른 속도로 추진할 수 있다”고 말했다. 리에쯔 좡 GUC 회장 겸 최고전략책임자는 NVLink Fusion이 하이퍼스케일러나 맞춤형 ASIC 설계사의 CPU·XPU를 타사 공정과 NVIDIA 기술에 연결해 통합 랙 규모 아키텍처를 구성한다고 설명했다.

NVLink Fusion은 건물, 전력, 냉각, 컴퓨팅과 네트워크를 함께 설계하는 NVIDIA DSX AI 팩토리 참조 아키텍처와 연계된다. NVIDIA Omniverse DSX AI Factory Blueprint는 기가와트급 AI 팩토리용 디지털 트윈과 개방형 참조 설계를 제공해 구축 전에 시설과 기술을 함께 모델링하도록 지원한다.

참조 컴퓨트 트레이는 팬, 케이블, 호스 없이 100% 액체 냉각을 적용하며 나머지 랙을 가동한 상태에서 트레이를 분리할 수 있다. NVLink Switch 트레이도 액체 냉각을 사용하고 정비 중 지속 운전을 지원한다.

CC 리 Amazon 계열사 Annapurna Labs 선임 하드웨어 개발 매니저는 “NVLink Fusion으로 검증된 NVL72 랙 설계를 활용해 시장 출시 시간을 확보하고, 여러 공급사를 통해 더 많은 제품을 고객에게 제공할 수 있다”고 말했다.

소프트웨어 계층에는 분산 워크로드용 NVIDIA NCCL, 분리형 구성을 위한 NVIDIA Dynamo·NIXL, 클러스터 관리·원격 측정·디버깅용 NVIDIA Mission Control이 포함된다. NVIDIA는 이를 통해 서로 다른 AI 인프라를 하나의 조정된 시스템으로 운용할 수 있다고 설명했다.

인공지능(AI)과 스타트업 분야의 주요 소식을 전합니다.