← All stories

Danijar Hafner développe des robots capables de planifier dans des espaces inconnus

Danijar Hafner, ancien de Google DeepMind, crée une start-up discrète qui utilise l’apprentissage par renforcement fondé sur des modèles et des robots humanoïdes importés pour aider les agents à gérer des environnements qu’ils n’ont pas rencontrés durant leur entraînement.

Pourquoi c’est important

Si l’entraînement sur des modèles du monde améliore les performances dans des configurations inconnues, les opérateurs pourraient tester davantage de tâches en simulation avant d’envoyer des robots dans des environnements domestiques variables ; les échecs de généralisation dans le monde réel interrompraient cet avantage.

Tech Trends Today publication

Ce qui a changé

Selon un reportage de MIT Technology Review, Danijar Hafner, ancien chercheur de Google DeepMind âgé de 31 ans, a lancé à San Francisco une entreprise de robotique en mode furtif. L’entreprise utilise des robots humanoïdes importés de Chine et l’apprentissage par renforcement fondé sur des modèles, en entraînant des agents dans des modèles du monde conçus pour les aider à gérer des plans d’étage, du mobilier et d’autres imprévus réels inconnus, sans dépendre autant des essais-erreurs physiques.

Pourquoi c’est important

Un robot qui ne fonctionne qu’après qu’une pièce a été cartographiée, répétée et rangée n’est qu’une démonstration sur pattes. L’enjeu commercial est une machine capable d’entrer dans un nouvel espace intérieur et d’y prendre malgré tout des décisions pertinentes.

La question opérationnelle passe ainsi de « Ce robot peut-il accomplir la tâche? » à « Combien de préparation du site, de supervision et de remise en état chaque nouvelle tâche exige-t-elle? » Si l’approche de Hafner se transpose de la simulation aux machines physiques, les opérateurs pourraient tester davantage de travail avant d’arriver sur site et déployer leurs robots dans des lieux plus variés sans devoir reconstruire le processus à chaque fois. Cela pourrait rendre les services robotiques viables dans des endroits dont les configurations sont trop variables pour une installation sur mesure.

Nos perspectives (spéculation éclairée): au cours des 6 à 12 prochains mois, l’entreprise devrait surtout se concentrer sur des essais intérieurs variés mais contrôlés avant de tenter un déploiement généralisé dans les foyers. La difficulté n’est pas d’imaginer un trajet dégagé autour d’un canapé. Elle consiste à faire en sorte que ce plan résiste à des capteurs imparfaits, à un mobilier difficile à contourner et à un matériel qui doit l’exécuter fidèlement.

La dernière fois que cela s’est produit

Le rover Opportunity de la NASA a testé sur le terrain Field D-Star en 2007, en utilisant des informations stéréo sur le terrain, des données sur les obstacles et l’odométrie visuelle pour planifier un itinéraire courbe autour des dangers. La similitude structurelle est manifeste: une machine physique a utilisé une représentation interne pour envisager un trajet avant de s’engager dans le mouvement.

La différence substantielle est tout aussi importante. Opportunity utilisait des cartes de terrain conçues par ingénierie et une planification déterministe pour des déplacements contraints sur Mars; l’effort attribué à Hafner emploie des modèles du monde appris pour des humanoïdes destinés à évoluer dans divers espaces humains. La NASA a ensuite indiqué que Perseverance avait utilisé la cartographie du terrain et la sélection autonome d’itinéraire pour trouver un passage sûr à travers une brèche inconnue, atteindre Citadelle et parcourir 167 mètres en un sol sous AutoNav. Ce résultat suggère que l’association de la planification et de la représentation peut améliorer sensiblement une navigation circonscrite. Il reste à déterminer si un modèle appris peut demeurer fiable dans la physique plus désordonnée et l’encombrement social d’un foyer.

Comment les effets pourraient se propager

Si des agents entraînés en simulation peuvent s’adapter de manière fiable à des configurations inconnues, les opérateurs de robots pourraient réduire les entraînements répétés sur site et les interventions manuelles de récupération. Ils pourraient ainsi affecter leur capacité à davantage de sites, au lieu de traiter chaque nouveau bâtiment comme un nouveau projet d’ingénierie.

L’effet en aval pourrait être un accès élargi aux services robotiques dans des foyers aux meubles et plans d’étage variables. La chaîne se rompt si le modèle ne prend pas en compte les conditions réelles, si l’humanoïde ne peut pas exécuter son plan de façon fiable ou si les opérateurs estiment que les performances de sécurité exigent encore une surveillance étroite.

Évaluation de l’impact

  • Opérateurs de robots, sur 6 à 12 mois: Bénéficiaires potentiels si la simulation remplace une partie des essais-erreurs physiques, réduisant la charge opérationnelle des sites inconnus.
  • Fournisseurs de robots humanoïdes, à court terme: Source potentielle de demande, à condition que l’entreprise de Hafner transforme son orientation de recherche en systèmes déployables.
  • Foyers aux configurations variables, à plus long terme: Le principal terrain de validation. Une meilleure adaptation pourrait élargir l’accès; un comportement peu fiable maintiendrait les déploiements dans des environnements contrôlés.

Scénarios

Le plus probable: Si l’entraînement fondé sur des modèles produit une adaptation utile mais que la fiabilité physique exige encore une validation progressive, l’entreprise consacrera ses ressources à des essais intérieurs contrôlés mais variés au cours des 6 à 12 prochains mois. Les opérateurs obtiendraient des éléments sur les situations où la simulation réduit la préparation, tandis qu’un déploiement domestique à grande échelle resterait prématuré. Des démonstrations dans des configurations inconnues et un besoin d’intervention moindre renforceraient ce scénario; un réentraînement intensif sur chaque site l’affaiblirait.

Scénario favorable: Si les modèles du monde se transfèrent bien à la perception et à l’action physiques, les robots pourraient évoluer dans des foyers inconnus ou des sites intérieurs tout aussi variables avec moins de cartes sur mesure et moins de récupérations manuelles. Les opérateurs pourraient alors étendre leurs projets pilotes à un éventail plus large de lieux, augmentant la capacité robotique utilisable là où la préparation répétée sur site constituait un goulet d’étranglement. Des exécutions fiables dans des environnements inconnus en seraient la preuve significative.

Scénario défavorable: Si l’écart entre l’expérience simulée et les conditions physiques entraîne des échecs de navigation ou de manipulation, les machines resteront cantonnées à des démonstrations étroites et contrôlées. Les opérateurs continueraient à investir massivement dans la supervision, la préparation et les essais en conditions réelles, limitant l’accès aux environnements qui ne peuvent pas être standardisés. Des interventions manuelles fréquentes face à de nouveaux obstacles iraient dans ce sens.

Ce qu’il faut surveiller ensuite

Il faudra surveiller les démonstrations dans des environnements intérieurs réellement inconnus, et non de simples répétitions soignées dans des pièces préparées. Il faudra également chercher des preuves que les agents entraînés en simulation exigent moins d’entraînement en conditions réelles et moins d’interventions des opérateurs; ces deux mesures mettraient mieux à l’épreuve la promesse centrale qu’un humanoïde traversant un sol familier.

Sources (8)
  1. MIT Technology ReviewThis AI entrepreneur is developing agents that can plan ahead for the unexpected
  2. iafrica.comAtlantica Ventures Has Backed Four African AI Infrastructure Startups in 18 Months. None of Them Build Models
  3. BBC SportFA to canvass England players in World Cup review
  4. netflix.comYA Novel Better Than the Movies Is About to Be, Well, a Movie
  5. Ars TechnicaSecond complete map of a fruit fly brain completed
  6. venturebeat.comChina-linked hackers backdoored executives' laptops via USB, exploiting a fix companies had but weren't using
  7. science.nasa.govD-Star Panorama by Opportunity
  8. science.nasa.govDriving Farther and Faster With Autonomous Navigation and Helicopter Scouting

Commentaires

Pas encore de commentaires.