
Le fait
Le 5 octobre 2026, Reflection AI présente Beam, son premier modèle à poids ouverts (open-weight). C’est une mixture d’experts de 501 milliards de paramètres, dont 23 milliards actifs à chaque token, pensée pour le code, le raisonnement et les tâches agentiques. Le modèle est uniquement textuel, a été pré-entraîné sur 23 800 milliards de tokens et accepte un contexte d’un million de tokens.
Beam n’est pas encore téléchargeable : il est en phase finale de red-teaming et d’évaluation, ouvert à une liste d’attente. Reflection promet de publier ce mois-ci les poids sous licence Apache 2.0, avec le rapport technique, la fiche modèle et les outils pour l’exécuter, l’évaluer et l’affiner.
Ce que revendique Reflection
L’argument central est l’efficacité. Selon l’entreprise, Beam obtient sur les tests de raisonnement avancé des scores comparables à GLM-5.2 (Z.ai) tout en consommant 3 à 4 fois moins de calcul d’inférence. Quelques chiffres publiés par Reflection : 80,9 sur SWE-Bench Verified, 90,5 sur GPQA Diamond, 97,8 sur AIME 2026. L’entreprise reconnaît elle-même que des modèles ouverts comme Kimi K3 restent devant en capacité brute.
Côté fabrication, Reflection décrit un apprentissage par renforcement à très grande échelle : plus de 100 millions d’essais générés sur 10 500 GPU NVIDIA GB300 pendant quatre semaines, à partir d’environ un million d’environnements d’entraînement. TechCrunch rappelle que ces résultats n’ont pas été vérifiés de façon indépendante.
Pourquoi ça compte
Fondée en 2024 par deux anciens de Google DeepMind, Reflection a levé environ 4,7 milliards de dollars (Nvidia, Sequoia, Lightspeed, selon PitchBook cité par TechCrunch). Elle vise les entreprises et les États avec des « AI factories » : des systèmes d’IA locaux, entraînés sur les données propres du client. Un premier test de partenariat souverain est en cours avec le groupe coréen Shinsegae.
Lecture Neurone21
Beam est une annonce, pas encore un produit. Le vrai test viendra avec la publication des poids et du rapport technique : licence réellement permissive, benchmarks reproduits par des tiers, coût matériel pour l’héberger. Pour une entreprise européenne, un grand modèle ouvert de plus élargit le choix face aux modèles chinois, mais un modèle de 501 milliards de paramètres demande une infrastructure lourde : à évaluer face à des modèles plus compacts.