Задача для робота звучит буднично: проверить, нет ли на кухне мусора, и выбросить его в ведро. На этом сценарии мобильной манипуляции Microsoft Research провела исследование. В блоге подразделения его называют первым систематическим изучением рабочих нагрузок в робототехнике.[1][2]
Сегодня в физическом ИИ, как пишут авторы, принято ставить GPU прямо на борт робота, например подключать его к роботу проводом. По оценке Microsoft Research, у такого решения есть цена. Бортовые GPU потребляют много энергии, сокращают время работы от батареи, добавляют роботу стоимость и вес и могут мешать запуску моделей ИИ последнего поколения.[3][4]
Главный вывод исследования в блоге сформулирован так: если инференс выполняется только на бортовом GPU, это может ограничивать производительность робота, время его автономной работы и масштабируемость. Перенос инференса на edge- или облачные GPU, по словам авторов, может дать значительные преимущества.[5]
Чем слабее бортовой ускоритель, тем заметнее потери. На GPU, где хватало памяти, картографирование и планирование работали до 383% медленнее, чем на A100. Авторы пишут, что из-за этого робот хуже справляется в динамичной обстановке. На более слабых GPU навигация на 30% реже вовремя замечала препятствия. VLA-модели на небольших GPU замедлялись не сильно, но и этого хватило, чтобы их точность упала на 50%. Некоторые слабые GPU вообще не вмещали стек мобильной манипуляции.[6][7][8][9]
Мощные бортовые чипы создают другую проблему. По данным Microsoft Research, крупные GPU вроде Jetson Thor увеличивали расход заряда батареи до 160%, то есть отнимали несколько часов работы, причём даже у крупных роботов. Чтобы оценить выигрыш, исследователи заменили бортовой GPU платой Raspberry Pi-5, которая лишь пересылает все данные на вынесенный GPU, и сравнили время автономной работы. Эти цифры получены на роботе Stretch-3.[10][11][12]
Для переноса вычислений Microsoft построила набор инструментов, который выносит инференс с робота и распределяет его между edge-GPU и облаком. Инструменты сами упаковывают рабочие нагрузки в контейнеры по декларативным описаниям, раскладывают их по узлам с помощью Kubernetes и работают с роботическими симуляторами, LeRobot и ROS2. «Kubernetes — естественная платформа, чтобы дать единую абстракцию для распределения роботизированного ИИ между вычислителем робота, edge-GPU и облаком», говорится в блоге.[13][14]
Эта функция появилась в Physical AI Toolchain, который Microsoft выпустила недавно. По описанию компании, это открытый фреймворк, готовый к промышленной эксплуатации, который объединяет облачные сервисы Microsoft Azure со стеком физического ИИ Nvidia. Возможность выносить инференс физического ИИ за пределы робота Microsoft называет первой в индустрии.[15][16]
В релиз вошли примеры проектов для роботов SO-101 и UR10e. Ещё одну демонстрацию компания показала на видео. Инференс модели Rho, которую Microsoft разработала для двуруких роботов, вынесен на GPU Jetson Thor, а тот управляет действиями робота Mobile Aloha.[17][18]
По материалам
Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.
Our research shows that running physical AI inference exclusively on onboard GPUs can limit robot performance, battery life, and scalability, and that offloading inference to edge or cloud GPUs can offer significant advantages.
We have built a toolset for easy inference offloading out of the robot and distributing inference between the edge GPU and cloud. Kubernetes is a natural platform to provide a uniform abstraction to distribute robotic AI between the robot’s compute, edge GPU, and overflowing to the cloud.
The toolset allows automatic containerization and offloading of robotics workloads using declarative specifications, distributes physical AI containers with smart policies using Kubernetes, and integrates with robotic simulators, LeRobot, and ROS2 for easy development.
Microsoft has recently released the Physical AI Toolchain (opens in new tab) for operationalizing physical intelligence at scale. Physical AI Toolchain is an open-source, production-ready framework that integrates Microsoft Azure (opens in new tab) cloud services with NVIDIA’s (opens in new tab) physical AI stack
The videos below show the offloading of the inference of Microsoft’s Rho model, targeted at dual-arm robots, to a Jetson Thor GPU, which controls the actions of the Mobile Aloha robot (opens in new tab).