Microsoft ajoute l’inférence déportée à sa toolchain IA physique

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Microsoft met en avant le déchargement de l’inférence pour la robotique, en complément ou en alternative aux GPU embarqués. L’éditeur publie une capacité dédiée dans sa Physical AI Toolchain et documente des gains de performances et d’autonomie mesurés sur des charges de manipulation mobile.
Autonomie et outillage : capacité d’inférence déportée disponible
Microsoft indique que des GPU embarqués plus grands, comme le Jetson Thor, ont pu entraîner une consommation de batterie jusqu’à 160% même sur des robots de grande taille. L’entreprise a récemment publié sa Physical AI Toolchain et y a ajouté une capacité d’inférence IA physique déchargée pour les robots. Cette version comprend des projets d’exemple pour le déchargement de l’inférence d’un SO-101 et d’un UR10e. Microsoft précise avoir déjà testé cette fonctionnalité dans de nombreux cas d’usage réels et met le code source à disposition, en invitant la communauté à faire remonter ses retours.
Performances mesurées : ralentissements avec GPU légers, gains en déportant
L’évaluation menée montre que certains GPU plus petits ne pouvaient pas faire tourner toute la pile de manipulation mobile. Sur des GPU disposant de mémoire suffisante, la cartographie et la planification ont montré des ralentissements allant jusqu’à 383% par rapport à un A100, ce qui limitait les capacités dans des environnements dynamiques. La navigation a subi une baisse de 30% dans la détection rapide des obstacles avec des GPU plus légers. Les modèles VLA n’étaient pas massivement ralentis mais la dégradation restait suffisante pour réduire leur précision de 50%. Selon Microsoft, les GPU embarqués limitaient les performances, tandis que le déchargement de l’inférence vers un GPU sur site ou dans le cloud améliorait les opérations, les taux de succès des tâches et l’usage de modèles plus volumineux, tout en aidant les robots à mieux réagir dans des environnements réels. Le déchargement a également permis d’améliorer le temps de réponse, la précision, l’autonomie de la batterie et le coût.
Compromis réseau : latence, bande passante et ressources à équilibrer
Le déchargement de l’inférence implique un compromis entre la performance, la latence, la bande passante réseau et la disponibilité des ressources GPU. Les modèles ont été évalués sur des configurations allant de l’embarqué à la périphérie et au cloud. Une comparaison spécifique a étudié l’effet sur l’autonomie en remplaçant un GPU embarqué par une Raspberry Pi 5 et en expédiant toutes les données vers le GPU déporté.
Contexte : pourquoi l’embarqué montre ses limites
Le modèle prédominant confine l’inférence au GPU du robot, la planification de haut niveau pouvant être réalisée dans le cloud tandis que l’exécution reste locale. Avec l’augmentation de la taille et de la sophistication des modèles, les contraintes de l’embarqué deviennent plus marquées : consommation d’énergie, réduction d’autonomie, coûts, poids et limites face aux modèles récents. Microsoft estime que le déchargement est essentiel pour opérer dans des environnements ouverts avec de grands modèles et de longues autonomies, et avance que remplacer un calcul embarqué par du matériel léger et une inférence à distance peut améliorer notablement l’endurance des robots.
Méthodologie et périmètre : manipulation mobile et trois capacités
Des recherches récentes se concentrent sur la manipulation robotique mobile, avec des tâches canoniques telles que localiser des déchets dans une cuisine, les ramasser et les jeter. Trois capacités clés ont été évaluées : cartographie sémantique et planification, navigation et manipulation. Les détails précis du matériel de test sont décrits dans un rapport technique distinct.
Chaîne d’outils : Kubernetes, simulateurs et intégration Azure–NVIDIA
Pour automatiser le déchargement, Microsoft a développé un ensemble d’outils qui orchestrent l’inférence entre périphérie et cloud, avec Kubernetes comme abstraction commune entre calcul embarqué, edge et cloud. L’outillage propose une containerisation automatique pilotée par des spécifications déclaratives et la distribution de conteneurs via des politiques Kubernetes, avec intégration à des simulateurs robotiques, à LeRobot et à ROS2. La Physical AI Toolchain est présentée comme un cadre open-source prêt pour la production, intégrant les services Azure avec la pile d’IA physique de NVIDIA. Ces briques visent les exigences d’une IA physique exposée à des environnements ouverts, à l’interaction avec humains et robots, et à la diversité d’incarnations, en complément des progrès matériels et modèles.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.