New 'GPT-6 Astra' Policy Annihilates Robot Manipulation Benchmark

Alors qu’on pensait que la guerre des benchmarks en robotique commençait enfin à stagner, une publication des chercheurs Yu-Mool Shu et Lipxin Zheng vient de jeter un énorme pavé dans la mare. Et le moins que l’on puisse dire, c’est que le niveau n’a pas seulement été relevé : il a été propulsé dans une autre galaxie. Intitulée “GPT 6 Astra as an Embodied Policy”, cette étude dévoile un nouveau modèle qui pulvérise littéralement la concurrence sur le benchmark de manipulation RoboDojo, une batterie de tests simulant des dizaines de tâches complexes (réelles et virtuelles) pour robots généralistes.

Les résultats sont, pour rester poli, totalement déséquilibrés. Cette nouvelle approche, un système hybride couplant un contrôleur baptisé π₀.₅ au redoutable modèle GPT-6 Astra, affiche un score moyen de 62,6 sur dix tâches clés. À titre de comparaison, son plus proche poursuivant, Galaxea G0.5, plafonne à 38,26. On ne parle pas ici d’une petite amélioration incrémentale, mais d’un bond de performance de 64 % qui fait passer les modèles établis de géants comme Xiaomi ou Meituan pour des tortues en fin de course. Ces travaux semblent s’appuyer sur des recherches antérieures concernant l’entraînement conjoint de modèles vision-langage-action (VLA) sur des données massives pour booster la généralisation en conditions réelles.

Détail piquant : l’étude évalue également le contrôle “GPT 6 Astra Direct”, qui se contente d’un score très quelconque de 37,81. Cela met en lumière le rôle crucial du contrôleur hybride π₀.₅, qui semble être le traducteur indispensable capable de métamorphoser l’intelligence brute du grand modèle de langage en actions physiques fluides et précises. Le projet étant annoncé comme open-source (un lien GitHub est déjà présent sur leur site), tout le secteur va sans doute se ruer sur cette nouvelle architecture pour tenter de la disséquer. Vous pouvez consulter la page du projet et les données ici : GPT 6 Astra as an Embodied Policy.

Pourquoi est-ce une révolution ?

Il ne s’agit pas uniquement de briller en haut d’un tableau Excel. Ce résultat marque un virage stratégique : on s’éloigne des politiques “monolithiques” de bout en bout pour privilégier des systèmes hybrides bien plus sophistiqués. L’écart de performance suggère que combiner un “cerveau” généraliste surpuissant comme GPT-6 Astra avec une politique de contrôle moteur spécialisée comme π₀.₅ est infiniment plus efficace que de demander au grand modèle de tout gérer en direct. Pour une industrie où même les meilleurs modèles peinent souvent à dépasser les 10 % de réussite sur des tâches complexes en conditions réelles, cette percée architecturale pourrait être le déclic nécessaire pour sortir enfin les robots des laboratoires et les lancer dans le monde sauvage, celui qui n’a pas été rangé au millimètre près pour eux.