
Le fait
Le 16 septembre 2026, NVIDIA publie les résultats de sa première soumission preview MLPerf Inference v6.1 sur Vera Rubin NVL72 (rack associant CPU Vera et GPU Rubin). Sur deux benchmarks exigeants du suite — Qwen3-VL (modèle vision-langage) et DeepSeek-R1 (raisonnement / mixture-of-experts) — Vera Rubin affiche jusqu’à 3,7× le débit du GB300 NVL72 sur Qwen3-VL, et jusqu’à 2,5× sur DeepSeek-R1.
La stack logicielle compte autant que le silicium : Qwen3-VL tourne avec vLLM et le framework open source NVIDIA Dynamo ; DeepSeek-R1 avec TensorRT-LLM. Les scénarios couvrent offline, server et interactive. En parallèle, NVIDIA montre le scaling du GB300 : une soumission DeepSeek-R1 sur quatre racks (288 GPU) atteint 99 % d’efficacité de scaling offline par rapport à un rack seul (72 GPU) — le débit croît presque linéairement avec le hardware ajouté.
Contexte
MLPerf Inference est le banc d’essai industriel de référence (MLCommons) pour comparer débits et latences d’inférence sous règles fermées. Vera Rubin est encore en catégorie preview (pas GA) : les chiffres indiquent une trajectoire, pas un catalogue d’achat figé. Le blog NVIDIA insiste sur trois leviers d’économie d’inférence : performance système (plus de tokens = plus de revenus potentiels), efficacité de scaling (ajouter des GPU doit rapporter proportionnellement), et cadence d’optimisation logicielle (jusqu’à 1,6× de gain GB300 Qwen3-VL entre v6.0 et v6.1 via précision KV cache, fusions de kernels, serving désagrégé).
Sous le capot annoncé : Tensor Cores / Transformer Engine améliorés, précision NVFP4, serving désagrégé (préfill vs decode séparés), parallélisme d’experts à grande échelle, et domaine scale-up NVL72 (NVLink 6e génération). L’écosystème suit : Nebius a aussi soumis des résultats preview Vera Rubin ; une vingtaine de partenaires apparaissent sur Blackwell / NVL72.
Pourquoi ça compte
1. L’inférence agentique change l’unité de mesure.
NVIDIA relie déjà Vera Rubin à des benches type AgentX (environ 30× vs GB300 en preview interne) et annonce un futur MLPerf Endpoints pour charges agentiques. Le rack ne se juge plus seulement en tokens/s chat.
2. Software velocity = moitié du récit.
1,6× sur le même GB300 entre deux rounds MLPerf rappelle qu’acheter le bon rack sans stack Dynamo / vLLM / TRT-LLM, c’est laisser de la marge sur la table.
3. 99 % de scaling = productivité infra.
Si doubler les GPU ne double pas le débit, le coût d’usine IA explose. Le chiffre 288 GPU / 99 % est le message adressé aux hyperscalers et aux acheteurs sovereign cloud.
4. Preview ≠ disponibilité.
Lire 3,7× comme un engagement de roadmap, pas comme un SLA livraison 2026-Q4. Croiser avec les calendriers partenaires (Nebius et autres).
Lecture Neurone21
Angle modeles-ia / stack inference : Vera Rubin NVL72 pose un nouveau plafond preview sur VLM et reasoning MoE, pendant que GB300 prouve qu’il scale encore presque linéairement. Pour un CTO infra : tracker la trilogie performance × scaling × software — et préparer les charges agentiques, pas seulement le throughput LLM classique.