엔비디아는 MLPerf Inference 6.1 사전 평가에서 Vera Rubin NVL72가 GB300보다 Qwen3-VL 처리량은 최대 3.7배, DeepSeek-R1은 최대 2.5배 높았다고 발표했습니다. 288개 GPU를 묶은 구성에서는 99%의 확장 효율을 제시했고 기존 장비도 소프트웨어 개선으로 성능이 향상됐습니다. 다만 제조사가 제출한 특정 모델과 구성의 결과이므로 실제 요청 길이와 지연 목표, 전력 및 도입 비용을 반영한 운영 성능은 별도로 검증해야 합니다.