엔비디아 Vera Rubin NVL72, MLPerf 추론 성능 선도 — AI 생성 일러스트
모델 뉴스

엔비디아 Vera Rubin NVL72, MLPerf 추론 성능 선도

NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut

NVIDIA Blog9월 16일 발표 · 3분

엔비디아가 최신 AI 인프라 플랫폼 Vera Rubin NVL72를 공개하며, MLPerf Inference v6.1 벤치마크에서 압도적인 성능을 입증했습니다.

세 줄 요약NVIDIA Blog 원문 기반
  1. Vera Rubin NVL72는 기존 대비 최대 3.7배 높은 처리량을 기록했으며, GB300 NVL72 역시 다중 GPU 환경에서 뛰어난 확장 효율성을 보여주었습니다.
  2. 이러한 성능 향상은 AI 서비스 제공 기업들이 토큰당 비용을 절감하고 장기적인 수익성(inference economics)을 확보하는 핵심 동력이 됩니다.
  3. 나아가, 미래 AI 시장은 단순 처리량 측정보다 추론 및 계획 능력을 포괄하는 에이전트 기반 워크로드 표준화가 중요해질 전망입니다.

엔비디아는 최신 AI 인프라 플랫폼인 Vera Rubin NVL72를 MLPerf Inference v6.1 에서 선보이며 업계 최고 수준의 성능을 입증했다. 이 시스템은 Qwen3-VL 및 DeepSeek-R1과 같은 까다로운 워크로드에서 뛰어난 처리량을 보여주었으며, 특히 Qwen3-VL 테스트에서는 GB300 NVL72 대비 최대 3.7배 높은 처리량을 기록하며 혁신적인 성능 향상을 과시했다.

기존 세대인 GB300 NVL72 역시 우수한 확장 효율성을 입증했다. DeepSeek-R1(DSR1) 테스트에서 단일 랙(72 )부터 네 개 랙(288 GPU)까지 스케일업했을 때 99%의 스케일링 효율을 달성하며, 추가된 하드웨어에 비례하여 처리량이 증가하는 모습을 보였다. 이러한 성능은 당 비용 절감과 장기적인 수익성 확보에 중요한 역할을 한다.

성능 향상은 하드웨어뿐 아니라 소프트웨어 최적화와도 연결된다. MLPerf Inference v6.1 제출 결과에서 GB300 NVL72는 이전 버전 대비 최대 1.6배의 성능 개선을 달성했으며, 이는 낮은 정밀도나 디스어그리게이션 서빙 등의 소프트웨어 최적화 덕분이다. 또한, 기반 워크로드(AgentX)와 같은 새로운 추론 방식에 대한 표준 측정 기준 마련이 중요하게 다뤄지고 있다.

용어 풀이

벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
KV 캐시
모델이 앞에서 계산한 값을 저장해 두고 다음 토큰을 만들 때 다시 쓰는 메모리. 입력이 길수록 커져요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문NVIDIA Blog · NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut
원문 보기NVIDIA Blog