
Le fait
Le 3 octobre 2026, jour de la réunification allemande, l’entreprise allemande Aleph Alpha publie Kolibri (« colibri »), un modèle de langage open-weight (poids téléchargeables) sous licence Apache 2.0, disponible sur Hugging Face sous le nom Aleph-Alpha/Kolibri-1.
Les caractéristiques clés, d’après le billet de lancement et la fiche modèle :
| Élément | Kolibri |
|---|---|
| Architecture | Mixture d’experts (MoE), 50 couches |
| Paramètres totaux | 78,1 milliards |
| Paramètres actifs par token | 3,46 milliards |
| Langues | Allemand, anglais |
| Contexte | 262 144 tokens natifs, validé jusqu’à 1 048 576 |
| Modes de raisonnement | none, low, medium, high |
| Pré-entraînement | 20 000 milliards de tokens, 21 jours, 768 GPU NVIDIA B200 |
| Licence | Apache 2.0 (poids et fichiers de configuration) |
| Matériel minimum | 2 A100 80 Go, 2 H100 SXM5, ou 1 H200 / B200 / B300 |
Une mixture d’experts est un modèle découpé en nombreux sous-réseaux spécialisés (ici 384 experts par couche, dont 6 activés à chaque token, plus un expert partagé) : on garde la « culture » d’un grand modèle, mais on ne paie le calcul que d’un petit. Contrepartie assumée par Aleph Alpha : tout le modèle doit tenir en mémoire (environ 78 Go en FP8).
Un modèle construit autour de la souveraineté
Aleph Alpha définit la souveraineté selon deux axes : comment le modèle a été construit et comment il se transfère au client.
Sur le premier axe, l’entreprise revendique une chaîne entièrement maîtrisée : modèle conçu en Allemagne, entraîné sur des infrastructures en Allemagne et en Finlande, « sous droit européen et allemand, sans contrôle étranger », de l’ingestion des données jusqu’aux évaluations finales. Kolibri est entraîné from scratch (aucune dépendance à un modèle tiers comme point de départ, selon la fiche Hugging Face).
Sur le second axe, la taille du modèle permet un déploiement sur site (on-premise), sans envoyer de données internes à un service d’inférence tiers. Aleph Alpha est par ailleurs signataire du Code de bonnes pratiques GPAI de l’Union européenne (le code qui décline les obligations de l’AI Act pour les modèles d’IA à usage général), publie un résumé public des données d’entraînement au format du modèle de la Commission, et indique un point de contact dédié aux ayants droit. Le billet affirme que Kolibri a été conçu « dès le départ » avec l’AI Act, le Code de bonnes pratiques et le RGPD en tête.
Attention à la portée exacte de la licence : l’Apache 2.0 couvre les poids et les fichiers de configuration publiés. La fiche précise que le code sous-jacent, l’architecture, les paramètres et les méthodes d’entraînement restent la propriété d’Aleph Alpha. C’est un open-weight, pas un modèle entièrement open source au sens « recette reproductible ».
L’allemand comme spécialité, pas comme traduction
Le parti pris le plus original est linguistique. Aleph Alpha a visé environ 20 % de données allemandes au pré-entraînement, après des tests sur petits modèles. Problème : les jeux de données ouverts ne fournissaient qu’environ 390 milliards de tokens allemands exploitables après filtrage, loin des 4 000 milliards visés.
L’équipe a comblé l’écart de trois façons : extraire elle-même l’allemand du web (Common Crawl) avec des filtres réglés pour la langue (les filtres standard éliminent les textes à mots longs… exactement le registre de l’administration allemande), reformuler des documents allemands existants (environ 1 000 milliards de tokens), et un usage limité de la traduction. Au final, un peu plus d’un cinquième du pré-entraînement est en allemand, et le tokenizer (le découpage du texte en unités) a été entraîné avec une nouvelle méthode, UniBPE, qui respecte les mots composés : « Bundessozialgerichtes » est découpé en « Bundes / sozial / gericht / es » plutôt qu’en fragments arbitraires. Moins de tokens par phrase, c’est moins de coût et de latence.
Ce que disent les chiffres (et ce qu’ils ne disent pas)
Aleph Alpha publie des benchmarks détaillés, tous mesurés avec ses propres outils d’évaluation. Quelques repères :
- Mathématiques : 96,0 sur AIME 2026 en anglais, 90,0 en allemand.
- Raisonnement scientifique : 84,3 sur GPQA Diamond.
- Code : 85,9 sur LiveCodeBench v6 et 66,4 sur SWE-Bench Verified.
- Score global anglais : 75,5, contre 71,4 pour Qwen3.6-35B-A3B, 73,0 pour Nemotron 3 Super 120B-A12B et 63,1 pour Mistral Small 4 119B-A6B.
L’entreprise affirme que Kolibri se situe sur la frontière de Pareto qualité / coût de service : aucun modèle comparé n’offre plus de qualité au même coût. Mais les tableaux montrent aussi ses limites. Le modèle dense Qwen3.8 27B fait mieux au global (80,2), au prix de bien plus de paramètres actifs. Sur SWE-Bench Verified, Qwen3.6-35B-A3B (73,8) devance Kolibri. Et sur TerminalBench 2.1, Kolibri (27,7) reste loin des meilleurs. C’est un modèle efficient et équilibré, pas un champion absolu.
« Je ne sais pas » comme fonctionnalité
Pour un client régulé, écrit Aleph Alpha, un modèle qui sait s’abstenir fait la différence entre un pilote et un déploiement. Kolibri a été entraîné avec des données où la bonne réponse est « je ne sais pas », et avec un protocole maison baptisé Merlin-Arthur : un « joueur » retire du document les éléments de preuve pour tenter de piéger le modèle, qui doit apprendre à refuser de répondre quand le contexte ne permet pas de conclure.
Résultat annoncé : sur AA-Omniscience, Kolibri s’abstient au lieu de se tromper dans 44 % des cas, contre 15 % pour la version précédente, Kolibri Origin. L’entreprise publie aussi des évaluations « proxy » de cas clients, en progression nette : secteur public allemand de 0,54 à 0,75, fournisseur automobile de 0,72 à 0,99, aéronautique de 0,14 à 0,59.
La fiche modèle reste prudente sur l’usage : Kolibri est destiné à des systèmes où un humain relit la sortie avant d’agir, pas à des agents autonomes non supervisés, et il se place du côté « conseil » dans l’aide à la décision.
Une usine à modèles, deux versions en trois mois
Côté industriel, le billet insiste sur la vitesse : Kolibri Origin (30 milliards de paramètres) a terminé son pré-entraînement le 11 juin 2026, Kolibri le 11 septembre. Entre les deux, le modèle est passé de 65 000 à 1 million de tokens de contexte et de 7 500 à 20 000 milliards de tokens d’entraînement. Pendant les 21 jours de pré-entraînement, 38 interruptions imprévues (pannes matérielles, coupures réseau) ont été gérées automatiquement, sans intervention humaine. Consommation énergétique estimée par la fiche : 950 MWh pour le pré-entraînement, le mid-training et l’extension de contexte.
Ce que ça change pour une entreprise française
1. Une option souveraine européenne de plus, mais pas en français. C’est la limite majeure pour nous : Kolibri est bilingue allemand–anglais par choix (« la profondeur plutôt que l’étendue »). Pour un usage en français, il faut tester sérieusement avant tout déploiement, ou regarder du côté de Mistral et d’autres modèles multilingues.
2. Un bon candidat pour les groupes franco-allemands. Industriels, équipementiers automobiles, aéronautique, filiales d’outre-Rhin : un modèle déployable sur site, sous licence permissive, performant en allemand technique et administratif, répond à un vrai besoin.
3. Un coût d’entrée matériel raisonnable. Un seul GPU H200 ou B200 (ou deux H100) suffit, d’après la fiche. C’est à la portée d’un datacenter d’entreprise ou d’un hébergeur qualifié, sans dépendre d’une API extra-européenne.
4. Un modèle de documentation de conformité. Signature du Code GPAI, résumé public des données, point de contact ayants droit, énergie déclarée : la fiche Kolibri est un bon gabarit de ce qu’un acheteur peut exiger de n’importe quel fournisseur de modèle sous l’AI Act.
Lecture Neurone21
Kolibri n’est pas un modèle frontière et ne prétend pas l’être. C’est un modèle de production, compact, documenté, déployable chez soi, et entraîné en Europe de bout en bout. Sa vraie leçon pour l’écosystème européen est stratégique : la souveraineté ne se gagne pas en courant après GPT-6 Astra, mais en spécialisant (une langue, des secteurs, une capacité d’abstention) et en industrialisant la fabrication de modèles. Reste une question pour la France : qui fera l’équivalent, aussi soigné, pour le français ?