
Le fait
Un article signé Kirill Brilliantov, Alejandro Hernández-Cano et Emmanuel Abbé (affiliations EPFL et Apple, travail effectué notamment en stage chez Apple), publié le 30 septembre 2026 sur arXiv (2609.40303), pose une question gênante pour l’industrie des agents : combien de « harnais » (harness : couche d’orchestration autour du modèle) faut-il vraiment pour l’ingénierie machine learning autonome ?
Réponse empirique des auteurs : sous budget temps égal, même backbone frontier et même matériel, les harnesses open-source « état de l’art » n’apportent pas d’avantage significatif par rapport à une seule session d’un agent coding à harnais minimal — baptisé Malena dans l’étude. Sur MLE-bench et NatureBench, Malena égale ou bat quatre systèmes multi-agents / search-tree testés. L’environnement d’exécution (accès direct fichiers + bash) est le facteur dominant ; au-delà, les ajouts (orchestration multi-agents, retrieval dédié, arbres de recherche complexes) ne bougent presque plus les scores.
Contexte : la tentation du scaffolding
Depuis les premiers agents MLE type recherche d’arbre sur du code, la mode a gonflé les machines externes : orchestrateurs multi-agents, sous-agents de retrieval, mémoires hiérarchiques, populations de programmes. Motif historique : un LLM en chat ne peut pas exécuter son code ni réagir à une erreur. Or les modèles récents, post-entraînés pour l’usage d’outils, vivent désormais dans des environnements type coding agent (ici OpenCode) : lire, écrire, lancer, debugger dans une session.
Les auteurs grimpent une échelle d’interventions dans un même codebase : du chat one-shot jusqu’à l’orchestration multi-agents. Conclusion : passer du chat à l’agent coding est le plus gros gain mesuré ; ensuite, aucune intervention n’améliore de façon statistiquement solide. Sur backbones faibles, un workflow crafté aide encore ; sur frontiers, « la leçon amère » (Sutton) revient : mieux vaut le modèle et le runtime que le scaffolding artisanal.
Limites assumées : bancs MLE (Kaggle) et NatureBench — pas le chaos d’un SI entreprise bruyant ; intervalles de confiance parfois larges ; coordination inter-agents sophistiquée peu explorée.
Pourquoi ça compte pour l’entreprise
1. Budget agents : simplifier avant d’empiler. Avant d’acheter une plateforme multi-agents à sept rôles, testez un agent unique bien outillé (shell, FS, jobs) sur vos tâches réelles.
2. KPI honnêtes. Beaucoup de gains publiés mélangent changement de backbone et changement de harnais ; Apple/EPFL forcent le match contrôlé.
3. Coût cache vs qualité. Malena peut coûter plus cher en tokens cache (longue session) tout en gagnant en médailles — le TCO se lit en résultat métier, pas en complexité d’archi.
4. Écho Neurone21. Cohérent avec nos billets sur les harnais : le runtime bat souvent le ballet d’agents.
Lecture Neurone21
Pour les DSI et leads data : la mode multi-agents n’est pas « fausse », mais souvent redondante dès que le modèle sait déjà boucler seul. Exigez des ablations backbone-fixées avant de financer une usine à orchestration.