
Le fait
Soumis le 8 septembre 2026 (arXiv 2609.09158), TANGO est présenté comme le premier framework de navigation vision-langage whole-body pour humanoïde en environnements cluttered. Équipe : UC Berkeley, Princeton, PKU, Tsinghua, HKU (Anqi Li, Dhruv Shah et al.). Déploiement zero-shot sur Unitree G1 sans aucune donnée de navigation réelle.
Contexte
Au lieu d’un plan 2D + contrôleur, TANGO prédit directement des chunks d’actions 29 DoF (angles articulaires + yaw base) à partir d’une instruction NL et de caméras égocentriques RGB. Architecture triple : System-2 (VLM Qwen2.5VL-7B), System-1 (MM-DiT + Real-Time Chunking), System-0 (tracker SONIC @ 200 Hz). Pipeline PET (Plan–Edit–Track) synthétise >64 000 trajectoires simu (sidestep, squat, stride).
Benchmarks : SR 43,75 % en scènes cluttered 3D (vs baselines modulaires) ; sur G1 réel, essais cités ~13–14/15 selon horizons (couverture AI Weekly / Phys.org ~23 sept.). Ablation : retirer le RTC coûte ~33 pts de succès.
Pourquoi ça compte
La navigation humanoïde utile n’est pas un pathfinding : c’est de la géométrie 3D corps entier. TANGO montre qu’on peut l’apprendre en simu et transférer zero-shot — prérequis pour maisons/entrepôts réels.
Lecture Neurone21
Suivre open-sourcing éventuel, extension loco-manipulation (ouvrir une porte plutôt que se faufiler), et adoption tracker SONIC. Complément naturel des VLA manipulation (Helix, π0…).