Neurone21
← Actualités

TANGO (Berkeley) : VLA whole-body pour naviguer un G1 dans le désordre

Modeles IA

TANGO

Le fait

Soumis le 8 septembre 2026 (arXiv 2609.09158), TANGO est présenté comme le premier framework de navigation vision-langage whole-body pour humanoïde en environnements cluttered. Équipe : UC Berkeley, Princeton, PKU, Tsinghua, HKU (Anqi Li, Dhruv Shah et al.). Déploiement zero-shot sur Unitree G1 sans aucune donnée de navigation réelle.

Contexte

Au lieu d’un plan 2D + contrôleur, TANGO prédit directement des chunks d’actions 29 DoF (angles articulaires + yaw base) à partir d’une instruction NL et de caméras égocentriques RGB. Architecture triple : System-2 (VLM Qwen2.5VL-7B), System-1 (MM-DiT + Real-Time Chunking), System-0 (tracker SONIC @ 200 Hz). Pipeline PET (Plan–Edit–Track) synthétise >64 000 trajectoires simu (sidestep, squat, stride).

Benchmarks : SR 43,75 % en scènes cluttered 3D (vs baselines modulaires) ; sur G1 réel, essais cités ~13–14/15 selon horizons (couverture AI Weekly / Phys.org ~23 sept.). Ablation : retirer le RTC coûte ~33 pts de succès.

Pourquoi ça compte

La navigation humanoïde utile n’est pas un pathfinding : c’est de la géométrie 3D corps entier. TANGO montre qu’on peut l’apprendre en simu et transférer zero-shot — prérequis pour maisons/entrepôts réels.

Lecture Neurone21

Suivre open-sourcing éventuel, extension loco-manipulation (ouvrir une porte plutôt que se faufiler), et adoption tracker SONIC. Complément naturel des VLA manipulation (Helix, π0…).

Sources

  1. arXiv / alphaXiv — TANGO 2609.09158 (8 sept. 2026)
  2. AI Weekly — Berkeley TANGO on Unitree G1 (9 sept. 2026)