실제 에이전트 코딩 세션 기반 AgentX로 성능 측정

동일 전력 예산에서 GPU 최대 40% 추가 운용 지원

핵심 요약

  • NVIDIA는 8월 24일 Vera Rubin NVL72가 GB300 NVL72보다 메가와트당 처리량을 최대 30배 높였다고 밝혔다.
  • NVIDIA에 따르면 8월 24일 공개한 Vera Rubin NVL72의 100만 토큰당 비용은 GB300 NVL72보다 최대 35배 낮다.
  • NVIDIA는 8월 24일 DSX MaxLPS가 같은 메가와트 예산에서 GPU를 최대 40% 더 배치하도록 지원한다고 밝혔다.

NVIDIA는 8월 24일 Vera Rubin NVL72가 에이전트형 AI 워크로드에서 GB300 NVL72보다 메가와트당 처리량을 최대 30배 높였다고 밝혔다. 이 수치는 실제 에이전트 코딩 세션을 기록한 SemiAnalysis AgentX 워크로드로 측정했으며, 결과는 현재 SemiAnalysis의 검토를 기다리고 있다.

에이전트형 AI는 금융 데이터베이스 조회, 뉴스·공시 검색, 하위 에이전트를 통한 비교·가치평가, 결과 종합 등 여러 단계를 이어서 수행한다. OpenRouter 데이터에 따르면 이런 워크로드는 단순 채팅 요청보다 토큰을 15배 더 사용한다. 단계마다 누적된 토큰이 다음 단계의 입력으로 넘어가므로 긴 문맥 처리가 성능의 핵심 요소다.

NVIDIA가 공개한 초기 측정 결과에서 Vera Rubin NVL72는 DeepSeek V4 Pro 모델을 구동할 때 GB300 NVL72보다 메가와트당 처리량이 최대 30배 높았다. 다만 이 결과에는 도구 호출을 담당하는 Vera CPU 성능이 아직 반영되지 않았다. NVIDIA는 지속적인 소프트웨어 최적화로 Vera Rubin NVL72와 GB300 NVL72의 성능이 계속 개선될 것이라고 설명했다.

AgentX는 실제 에이전트 코딩 과정에서 나타난 문맥 증가와 도구 호출, 하위 에이전트 생성을 보존한 워크로드다. 채팅이나 문서 요약의 입출력 길이는 보통 1K~8K 토큰이지만, 에이전트 세션의 입력 문맥은 단계가 거듭되면서 수십만 토큰에 이를 수 있다. NVIDIA는 이 때문에 단일 추론 요청이 아니라 전체 에이전트 작업 흐름을 기준으로 성능을 측정해야 한다고 밝혔다.

SemiAnalysis AgentX 측정에서 NVIDIA Blackwell 플랫폼은 Kimi K3, MiniMax M3, GLM5.3, Qwen3.5, DeepSeek V4 Pro 등 여러 에이전트형 모델에서 성능을 측정했다. GB300 NVL72는 DeepSeek V4 Pro 모델에서 NVIDIA Hopper 아키텍처보다 메가와트당 처리량이 최대 15배 높게 나타났다. NVIDIA는 더 큰 스케일업 GPU 도메인과 하드웨어·소프트웨어 공동 설계가 추론 효율 향상에 기여했다고 설명했다.

전력 효율은 토큰 비용에도 연결된다. NVIDIA에 따르면 Vera Rubin NVL72의 100만 토큰당 비용은 GB300 NVL72보다 최대 35배 낮다. 전력 공급이 제한된 AI 팩토리에서는 같은 에너지 사용량으로 처리할 수 있는 에이전트 작업이 최대 30배 늘어난다는 계산이다.

NVIDIA DSX MaxLPS는 GPU와 랙, 워크로드 수준에서 전력을 관리해 같은 메가와트 예산 안에 GPU를 최대 40% 더 배치하도록 지원한다. NVIDIA는 메가와트당 처리량이 AI 팩토리 매출에, 100만 토큰당 비용은 그 매출의 이익률에 직접 영향을 준다고 밝혔다.

Vera Rubin NVL72는 문맥 처리인 프리필과 응답 생성인 디코드를 분리해 각각 확장하는 분리형 서빙을 지원한다. 레이트 매칭은 프리필 GPU와 디코드 GPU의 토큰 생성 속도를 맞추며, 대규모 전문가 병렬화는 혼합 전문가 모델의 하위 네트워크를 스케일업 GPU 도메인에 분산한다.

분산 KV 캐싱은 메모리를 GPU 도메인 전반으로 확장하고, KV 캐시 오프로딩은 사용 빈도가 낮은 문맥을 호스트와 스토리지로 옮겨 재계산 없이 활용하게 한다. KV 인식 라우팅은 관련 문맥을 이미 캐시한 GPU로 요청을 보내 중복 계산을 줄인다. MegaMoE 같은 융합 CUDA 커널은 여러 연산과 GPU 간 통신을 한 번의 실행 단계로 결합한다.

Rubin GPU는 5세대 Tensor Core와 3세대 Transformer Engine으로 프리필과 디코드 단계를 가속한다. NVFP4 양자화는 모델 가중치를 4비트 정밀도로 압축해 출력 품질을 희생하지 않으면서 메모리 사용량을 줄이고 처리량을 높인다고 NVIDIA는 설명했다.

Vera Rubin과 Grace Blackwell에 적용된 NVL72 스케일업 도메인은 대규모 전문가 병렬화와 분산 KV 캐싱에 필요한 GPU 간 고대역폭·저지연 통신을 제공한다. 6세대 NVIDIA NVLink와 NVLink Switches는 기성 이더넷 대안보다 패킷 처리율이 10배 높고 지연 시간은 3배 낮다는 게 회사 측 설명이다.

NVIDIA 소프트웨어 스택은 최적화된 CUDA 커널과 NVIDIA TensorRT LLM 추론 런타임, NVIDIA Dynamo 서빙 프레임워크를 하드웨어와 공동 설계해 추론 최적화를 지원한다. 전체 Vera Rubin 플랫폼은 NVIDIA Vera CPU, Groq 3 LPU, NVLink 6 Switch, BlueField-4 DPU, Spectrum-6 SPX, ConnectX-9 SuperNIC을 포함한 7개 칩 아키텍처다. NVIDIA는 Vera Rubin이 완전 생산 단계에 들어갔으며 생태계 전반으로 규모를 확대하고 있다고 밝혔다.

인공지능(AI)과 스타트업 분야의 주요 소식을 전합니다.