O que é Mobile ALOHA? Como ele possibilita o Robot Learning?

O que é Mobile ALOHA e como ele ajuda os robôs a aprender tarefas complexas do mundo real? Este artigo apresenta o sistema de manipulação móvel bimanual de baixo custo de Stanford e explica como a teleoperação de corpo inteiro permite a coleta de dados do mundo real para aprendizado por imitação, aprendizado de robôs e pesquisa de IA incorporada.

Atualizado em
O que é Mobile ALOHA? Como ele possibilita o Robot Learning?
À medida que a IA física passa da simulação para o mundo real, um desafio está se tornando cada vez mais importante: como os robôs podem coletar dados do mundo real de alta qualidade suficientes para aprender tarefas físicas complexas?

Uma abordagem influente é Mobile ALOHA, um sistema de manipulação móvel bimanual de baixo custo desenvolvido por pesquisadores de Stanford. Em vez de programar manualmente cada movimento, o Mobile ALOHA permite que humanos demonstrem tarefas por meio de teleoperação de corpo inteiro e usa essas demonstrações como dados de treinamento para o aprendizado de robôs.

O projeto foi desenvolvido por Zipeng Fu, Tony Z. Zhao e Chelsea Finn na Universidade de Stanford. Sua pesquisa concentra-se em manipulação móvel bimanual, teleoperação de corpo inteiro, aprendizado por imitação e aprendizado de robôs eficiente em dados.

O que é Mobile ALOHA?

O Mobile ALOHA é um sistema de manipulação móvel bimanual de baixo custo e de código aberto que estende a plataforma ALOHA com uma base móvel e teleoperação de corpo inteiro.
A plataforma ALOHA original foi projetada para permitir que operadores humanos controlassem dois braços robóticos e coletassem demonstrações para aprendizado por imitação. O Mobile ALOHA estende essa configuração além de um espaço de trabalho fixo sobre uma mesa. Ao adicionar mobilidade, o robô pode combinar navegação, posicionamento e manipulação bimanual dentro da mesma tarefa.

Em alto nível, o Mobile ALOHA consiste em:

Componente
Função
Plataforma móvel

Permite navegação autônoma e mobilidade em ambientes dinâmicos
Sistema de quatro braços (2 líderes, 2 seguidores)
Executa manipulação bimanual precisa por meio de uma arquitetura sincronizada líder-seguidor
Sistema de visão (Câmeras)
Captura dados visuais de alta fidelidade para estimativa de estado e percepção do ambiente
Interface de teleoperação
Facilita a demonstração intuitiva de tarefas e a coleta de dados
Computação embarcada
Processa dados multimodais em tempo real e implementa políticas de controle aprendidas

Esta arquitetura permite que o mesmo sistema desempenhe dois papéis: um robô teleoperado para coletar demonstrações e um robô autônomo para executar comportamentos aprendidos.


Por Que o Mobile ALOHA Se Tornou Tão Popular?

As demonstrações públicas do Mobile ALOHA mostraram algo difícil para os sistemas robóticos convencionais: um robô relativamente barato podia aprender uma ampla variedade de tarefas físicas a partir de uma quantidade menor de demonstrações humanas.
As tarefas incluíam cozinhar, abrir armários, enxaguar panelas, limpar líquidos derramados, empurrar cadeiras, chamar e entrar em elevadores e outras atividades domésticas.

No entanto, a principal inovação não é que o Mobile ALOHA foi programado com centenas de comportamentos individuais. Em vez disso, o sistema oferece uma forma de humanos demonstrarem uma tarefa diretamente no robô físico. Essas demonstrações podem então se tornar dados de treinamento para uma política de aprendizado por imitação. Isso cria um ciclo simples, que é fundamental para a pesquisa em IA física:
Demonstração humana → Dados do mundo real → Aprendizado do robô → Política → Execução autônoma


Como o Mobile ALOHA Aprende Com Dados do Mundo Real?

O Mobile ALOHA usa teleoperação de corpo inteiro para coletar demonstrações para o aprendizado por imitação. Durante uma tarefa, um operador humano controla os braços e a base móvel do robô enquanto o sistema registra observações sincronizadas e ações do robô.

Os dados coletados incluem observações de câmera RGB, posições das juntas do robô, velocidade da base móvel, ações do robô e informações proprioceptivas. O sistema original usa três câmeras RGB — duas montadas no pulso e uma voltada para a frente — para capturar a interação do robô com seu ambiente. O processamento de dados e a inferência são realizados por um laptop equipado com um processador Intel Core i7-12800H e GPU NVIDIA RTX 3070 Ti.

O pipeline de aprendizado é baseado em Action Chunking with Transformers (ACT), um método de aprendizado por imitação baseado em Transformer desenvolvido para o sistema ALOHA. O ACT prevê sequências de ações do robô a partir de observações, permitindo que o robô aprenda comportamentos a partir de demonstrações humanas e os execute de forma autônoma. Isso ajuda o robô a aprender comportamentos complexos de manipulação a partir de números relativamente pequenos de demonstrações humanas.


Quantos Dados do Mundo Real o Mobile ALOHA Precisa?

Uma das descobertas notáveis da pesquisa do Mobile ALOHA é seu foco em eficiência de dados. O conjunto de dados ALOHA de código aberto já oferece uma base substancial, com 825 tarefas de demonstração cobrindo uma ampla gama de comportamentos de manipulação. Estes incluem selar sacos, pegar garfos, embalar doces, rasgar toalhas de papel, abrir copos com tampa, jogar tênis de mesa, operar uma máquina de café, virar lápis, fixar cabos com Velcro, inserir baterias e usar uma chave de fenda.

Em vez de coletar todos os dados de treinamento do zero no robô móvel, o Mobile ALOHA combina novas demonstrações de manipulação móvel com dados ALOHA existentes.
Para várias tarefas de manipulação móvel, os pesquisadores usaram 50 demonstrações por tarefa e descobriram que o co-treinamento com dados estáticos do ALOHA podia melhorar significativamente o desempenho. Em alguns experimentos, o co-treinamento alcançou taxas de sucesso de até 90%, dependendo da tarefa.

Isso demonstra um princípio importante para o aprendizado de robôs no mundo real:
Conjuntos de dados existentes podem ser reutilizados como base, reduzindo a quantidade de novos dados específicos de tarefa que precisam ser coletados em robôs físicos.

Hardware e Custo do Mobile ALOHA

O Mobile ALOHA foi construído principalmente a partir de componentes disponíveis comercialmente, em vez de uma plataforma robótica totalmente personalizada. O sistema utiliza uma plataforma de robô móvel AgileX Robotics TRACER, dois braços seguidores ViperX 300, dois braços líderes para teleoperação, três câmeras RGB Logitech C922x, alimentação por bateria integrada e um laptop para computação.

Especificações principais
Mobile ALOHA
Tipo de sistema
Manipulação móvel bimanual
Plataforma móvel
AgileX Robotics AGV diferencial de 2 rodas TRACER
Braços seguidores
2 × ViperX 300
Braços de teleoperação
2 × braços líderes
Câmeras
2 de pulso + 1 frontal
Resolução da câmera
480 × 640
Frequência da câmera
50 Hz
Computação
Intel i7-12800H + NVIDIA RTX 3070 Ti
Bateria
1,26 kWh
Alcance vertical
65–200 cm
Extensão horizontal
Até 100 cm
Carga útil
Até 1,5 kg
Orçamento aproximado do sistema
$32,000

O orçamento do sistema relatado foi de aproximadamente $32,000, o que é particularmente significativo no contexto da coleta de dados no mundo real: quanto menor o custo de cada plataforma física de coleta de dados, mais fácil se torna escalar experimentos de aprendizado de robôs.


COBOT MAGIC: Uma Plataforma Baseada no Mobile ALOHA para Coleta de Dados no Mundo Real

As ideias demonstradas pelo Mobile ALOHA também inspiraram plataformas comerciais e de pesquisa baseadas na mesma arquitetura. Um exemplo é o COBOT MAGIC, uma plataforma móvel de teleoperação com dois braços desenvolvida pela AgileX Robotics com base na arquitetura Mobile ALOHA.

O COBOT MAGIC combina uma base móvel, múltiplos braços robóticos, câmeras, computação integrada e hardware de teleoperação em uma plataforma projetada para aprendizado de robôs, coleta de dados de IA incorporada e pesquisa de manipulação móvel.


Diferentemente da configuração de pesquisa original do Mobile ALOHA, o COBOT MAGIC utiliza uma configuração mais poderosa centrada em TRACER 2.0, braços robóticos PiPER, percepção de profundidade e um PC industrial.

Componente
Configuração
Plataforma móvel
TRACER 2.0, tração diferencial de 2 rodas
Câmera de profundidade
Orbbec Dabai
Expansão USB
4 × portas USB
Braço robótico
4 × PiPER, 6-DoF
Garra
Personalizado AgileX
Teach pendant
Personalizado AgileX
Gaveta de armazenamento
410, configuração personalizada de 4 posições
Interruptor de energia principal
1,8 m
Estrutura do robô
1125 × 758 × 1507 mm
Fonte de alimentação móvel externa
Personalizado AgileX
PC industrial
Intel Core i7-13700 / 32 GB RAM / 2 TB SSD / NVIDIA RTX 4060
Teclado
Logitech
Tela
11,6 polegadas, 1080P


COBOT MAGIC para coleta de dados de IA incorporada

O COBOT MAGIC é uma plataforma de teleoperação móvel com dois braços baseada na arquitetura Mobile ALOHA, projetada para coleta de dados no mundo real e aprendizado de robôs. A plataforma pode coletar dados multimodais do mundo real, incluindo:
  • Visão e profundidade
  • Status do robô e estados das juntas
  • Dados de movimento
  • Ações e trajetórias de teleoperação
Isso torna o COBOT MAGIC adequado para teleoperação bimanual, aprendizado por imitação, coleta de dados de tarefas de longo horizonte e treinamento de modelos de IA incorporada. Seu ecossistema de software aberto oferece suporte a ROS 1 / ROS 2, bem como ambientes de simulação, incluindo Gazebo, Isaac Sim e MuJoCo. Também fornece SDKs e algoritmos de exemplo, com suporte a frameworks e modelos como LeRobot, π0, π0.5 e RDT.


Dos dados do mundo real ao aprendizado de robôs

A relação entre o Mobile ALOHA e plataformas como o COBOT MAGIC pode ser entendida como um ciclo contínuo de desenvolvimento:
Demonstração humana → Teleoperação → Dados multimodais do mundo real → Treinamento de política → Validação em simulação → Avaliação em robô real → Novos dados
A ideia central é que o robô físico não é simplesmente o ponto final de um modelo de IA. Ele também pode se tornar uma plataforma de geração de dados e aprendizado. Demonstrações humanas fornecem exemplos do mundo real, políticas aprendidas são avaliadas em robôs físicos, e a experiência resultante pode retornar para treinamentos adicionais.

À medida que o aprendizado de robôs e VLA sistemas continuam a evoluir, formas escaláveis de coletar e reutilizar dados multimodais de alta qualidade do mundo real permanecerão uma parte importante da construção de sistemas de IA física capazes.

FAQ

Conceitos Fundamentais e Posicionamento

  • O que é a plataforma ALOHA?

  • Um sistema de hardware e software de baixo custo e código aberto projetado especificamente para teleoperação bimanual e coleta de dados de aprendizado robótico.

  • Como o Mobile ALOHA se relaciona com a IA física?

  • Ao adicionar mobilidade ao ALOHA original, ele serve como uma arquitetura de referência prática para IA física. Permite a coleta eficiente de dados multimodais do mundo real por meio de demonstrações humanas para treinar políticas de aprendizado robótico.

Coleta de Dados e Mecanismos de Aprendizado

  • Como o sistema coleta dados e aprende tarefas?

  • Ele registra observações visuais, estados do robô e ações durante a teleoperação de corpo inteiro. O sistema aprende por meio de aprendizado por imitação e clonagem comportamental supervisionada, suportando algoritmos como ACT, Diffusion Policy e VINN.

  • Quantas demonstrações são necessárias?

  • É altamente eficiente em dados. Pesquisas mostram que, quando combinado com dados estáticos existentes do ALOHA, apenas cerca de 50 demonstrações humanas são suficientes para aprender tarefas desafiadoras de manipulação móvel.

Custo do Sistema e Soluções Comerciais da AgileX

  • Qual foi o orçamento da arquitetura original?

  • O sistema de pesquisa original Mobile ALOHA foi construído com um orçamento de aproximadamente US$ 32.000, incluindo energia e computação embarcadas.

  • O que é o COBOT MAGIC?

  • É uma plataforma de teleoperação bimanual móvel de nível comercial baseada na arquitetura Mobile ALOHA. Ela integra profundamente uma base móvel TRACER 2.0, braços robóticos PiPER, sensoriamento de profundidade e computação embarcada. Com um ecossistema de software totalmente aberto, capacita desenvolvedores a construir e implantar soluções de IA incorporada prontas para uso.

 

Referências

Enorme agradecimento a Zipeng Fu, Tony Z. Zhao e Chelsea Finn da Stanford University por esse progresso incrível.

Robô Mobile ALOHA: https://mobile-aloha.github.io/
COBOT MAGIC: https://global.agilex.ai/products/cobot-magic
ALOHA: https://tonyzhaozh.github.io/aloha/
ALOHA 2: https://arxiv.org/abs/2405.02292
ACT (Action Chunking with Transformers): https://huggingface.co/docs/lerobot/act

 

Atualizado em