
Le fait
Le 30 septembre 2026, lors de Fully Connected, sa conférence annuelle à San Francisco (plus de 4 500 participants revendiqués), le cloud spécialisé IA CoreWeave a annoncé la disponibilité de NVIDIA Vera Rubin NVL72, la nouvelle génération de systèmes « à l’échelle de la baie » (rack-scale) de NVIDIA, avec le réseau Ethernet Spectrum-X 102.4T. Premier client à y faire tourner de la production : Cognition, le laboratoire qui développe Devin, un agent qui écrit du code de façon autonome.
Nuance utile : le communiqué parle de disponibilité, mais le blog de CoreWeave précise qu’il s’agit d’une disponibilité limitée, avec quelques centaines de GPU Rubin déployés dans plusieurs régions. L’accès reste donc réservé à des clients sélectionnés.
Cognition, de la livraison à la production en quelques jours
Cognition entraîne, affine par apprentissage par renforcement (RL, l’entraînement par essais et récompenses) et sert Devin sur CoreWeave. Elle est passée de capacités d’appoint à des milliers de GPU en moins de neuf mois. Le cluster Vera Rubin a été monté début septembre, et les charges de travail tournaient quelques jours après la remise des baies, selon CoreWeave.
Les ingénieurs de Cognition ont mené leur propre test, sur des tâches de génie logiciel tirées du jeu FrontierCode et résolues par des agents :
- jusqu’à 4,8 fois plus de débit total de tokens (les unités de texte traitées par le modèle) en inférence pour leur modèle SWE-2, face à une base GB200 NVL72 ;
- 3,8 fois plus de tokens générés pour les charges d’apprentissage par renforcement.
« Le code agentique est une charge de travail impitoyable, qui exige de longs contextes, beaucoup de requêtes simultanées et un raisonnement rapide », explique Silas Alberti, membre de l’équipe fondatrice de Cognition. Pour l’entreprise, ces gains se traduisent par plus de sessions Devin par GPU et un coût par session plus bas.
Limite soulignée par StorageReview : ce sont des mesures du client lui-même, sans taille de modèle, longueur de contexte ni paramètres de lot publiés. À lire comme un ordre de grandeur, pas comme un banc d’essai indépendant.
Vera, le CPU pensé pour les agents
CoreWeave proposera aussi NVIDIA Vera, présenté comme le premier processeur conçu pour les agents IA, sans date précise au-delà d’un « bientôt ». Pourquoi un CPU ? Pour entraîner et faire tourner des agents, il faut lancer des milliers d’environnements isolés en parallèle : exécution de code, appels d’outils, évaluations.
Une baie Vera chez CoreWeave regroupe 128 CPU et 11 264 cœurs, de quoi faire tourner plus de 11 000 environnements simultanés à un cœur chacun, avec des DPU BlueField-4 (cartes qui gèrent réseau et sécurité) et des commutateurs Spectrum-X. Dans ses tests, CoreWeave mesure un démarrage des bacs à sable d’agents plus de 3 fois plus rapide, face à un CPU x86 non précisé, et un gain de 1,7 fois sur le test Terminal-Bench.
Forge : boucler la production et l’entraînement
Troisième annonce, CoreWeave Forge réunit Weights & Biases, l’expertise en post-entraînement d’OpenPipe et les notebooks open source marimo dans un même environnement. L’idée : les traces des agents en production alimentent directement l’entraînement de la version suivante. Les bacs à sable (Sandboxes) et l’assistant ARIA sont disponibles, l’outil d’analyse Agent Lens est en préversion. Canva, Capital One et MasterClass font partie des premiers utilisateurs. Les gains annoncés (par exemple un RL « serverless » 1,4 fois plus rapide pour 40 % de coût en moins) restent des chiffres maison, sans méthodologie détaillée.
Ce que dit NVIDIA
« Le calcul accéléré NVIDIA crée de la valeur d’une génération à l’autre », affirme Ian Buck, vice-président hyperscale et calcul haute performance chez NVIDIA, sur le blog du groupe. Il rappelle que des GPU V100 tournent encore chez CoreWeave près de dix ans après le lancement de l’architecture Volta, au moment où Vera Rubin entre en production.
Lecture Neurone21
Vera Rubin passe de la feuille de route aux clients payants, et c’est un agent de code qui ouvre le bal : signe que les charges agentiques, longues et très parallèles, deviennent le terrain de référence. Pour une entreprise européenne, l’accès direct restera rare à court terme. L’intérêt concret est ailleurs : le coût par tâche d’agent devrait baisser chez les éditeurs qui adoptent ces machines. Le CPU Vera rappelle aussi que faire tourner des agents, c’est surtout beaucoup d’environnements isolés, un point à intégrer dans toute architecture sérieuse.
Sources
- From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI — NVIDIA Blog (30 septembre 2026)
- CoreWeave Delivers NVIDIA Vera Rubin NVL72 Performance at Production Scale, Starting With Cognition — CoreWeave (30 septembre 2026)
- CoreWeave Puts NVIDIA Vera Rubin NVL72 Into Production — StorageReview (2 octobre 2026)