Introdução: A Generalização da IA Física É um Problema de Dados

E se os humanos pudessem demonstrar tarefas simplesmente por conta própria, sem estar fisicamente conectados ao robô?
O Que É a UMI (Universal Manipulation Interface) e Como Ela Funciona?
Demonstração Humana → Interface UMI → Dados Multimodais → Política do Robô → Implantação do Robô
Etapa 1: Demonstrar a tarefa
Etapa 2: Capturar a demonstração
Etapa 3: Aprender a política do robô
Etapa 4: Implantar e escalar a política
Como Montar uma Configuração de Hardware da UMI e Quanto Custa

-
GoPro montada no punho com lente olho de peixe de FoV amplo: Captura um enorme campo de visão de 155°, garantindo que tanto os dedos da garra quanto o alvo de manipulação permaneçam no quadro, fornecendo um contexto visual essencial.
-
Espelhos laterais para estéreo implícito: Uma solução engenhosa para a percepção de profundidade. Ao adicionar espelhos laterais angulados à garra, uma única câmera pode capturar múltiplas perspectivas, fornecendo a informação de profundidade crucial necessária para uma manipulação precisa, sem sistemas de múltiplas câmeras caros.
-
Rastreamento de Pose com IMU: Usa a Inertial Measurement Unit (IMU) integrada à GoPro combinada com SLAM visual para rastrear o movimento preciso de 6-DoF do gripper no espaço, mesmo durante movimentos rápidos e dinâmicos, como arremessar objetos.
-
Rastreamento Contínuo do Gripper: Rastreia ajustes finos na largura de preensão diretamente do feed visual e dos mecanismos físicos.
-
Filtragem de Dados Baseada em Cinemática: Verifica automaticamente se a demonstração de um humano é fisicamente possível para os limites articulares específicos do robô-alvo antes do treinamento.
UMI vs. Teleoperação vs. Coleta de Dados Ego-Cêntrica
Teleoperação (ex.: ALOHA): Fidelidade Centrada no Robô
-
O Fluxo de Trabalho: Humano → Robô → Dados.
-
A Vantagem: Nenhuma lacuna de incorporação. Os dados correspondem perfeitamente ao espaço de ação do robô, ideal para precisão inferior a 2mm.
-
O Detalhe: Escalar é difícil. É caro, requer configuração extensa e está sempre limitado a laboratórios.
-
A Velocidade: Com base no artigo original do UMI, tomando a tarefa "Cup Arrangement" como exemplo, a teleoperação tradicional via SpaceMouse produziu apenas 35 demonstrações por hora.

Arquitetura de Teleoperação ALOHA 2
UMI (ex.: AgileX Pika): Portátil, Rápido e Transferível
-
O Fluxo de Trabalho: Humano → UMI → Dados → Robô.
-
A Vantagem: Escalabilidade incomparável. Dez operadores podem usar dez grippers UMI simultaneamente em dez locais diferentes.
-
A Velocidade: Como depende de movimentos naturais da mão humana, o UMI alcançou 111 demonstrações por hora para exatamente a mesma tarefa de arranjo de copos — mais de 3x mais rápido que a teleoperação.

Sistema de Coleta de Dados baseado em UMI do Pika Pro
Coleta de Dados Ego-Cêntrica: Capturando a Perspectiva Humana
-
O Fluxo de Trabalho: Humano → Sensores Vestíveis → Dados Contextuais.
-
A Vantagem: Escala massiva e contexto ambiental. Captura interações naturais em primeira pessoa de forma contínua em ambientes cotidianos.
-
O Detalhe: A "Lacuna de Ação". Captura o que aconteceu visualmente, mas muitas vezes carece dos dados cinestésicos precisos (como largura exata do gripper, força e trajetórias em nível de milímetro) necessários para treinar diretamente uma política de manipulação de robô.
-
A Velocidade: Passiva e altamente escalável. Uma pessoa pode usar uma câmera (como óculos AR ou um suporte de peito) e coletar horas de dados simplesmente ao longo do seu dia.
A teleoperação captura ações centradas no robô. A UMI captura demonstrações estruturadas de manipulação humana. As abordagens egocêntricas capturam a interação humano-ambiente mais ampla.
Matriz de Comparação Rápida
|
Recurso
|
Teleoperação (ex.: ALOHA)
|
UMI (ex.: AgileX Pika)
|
Egocêntrica
|
|
Fonte Primária de Dados
|
Execução direta do robô
|
Manipulação humana via interface
|
Interação humana em primeira pessoa
|
|
Robô necessário durante a coleta
|
Durante todo o processo
|
Não
|
Não
|
|
Custo de Hardware
|
Relativamente Alto ($20K+)
|
Baixo (~$800)
|
Baixo
|
|
Foco principal
|
Ações específicas do robô
|
Demonstrações de manipulação transferíveis
|
Interação humano-ambiente
|
|
Informação de ação
|
Ações diretas do robô
|
Ações de manipulação explícitas
|
Pode exigir inferência de ação ou sensoriamento adicional
|
|
Velocidade de Coleta
|
Lenta (~35 demos/h)
|
Rápida (~111 demos/h)
|
Muito Rápida (Passiva)
|
|
Ambiente
|
Restrito
|
Em qualquer lugar, no mundo real
|
Em qualquer lugar, no mundo real
|
|
Escalabilidade
|
Moderado
|
Alto
|
Potencialmente muito alto
|
|
Mais indicado para
|
Controle específico do robô
|
Transferência de habilidade de manipulação
|
Dados de interação humana em larga escala
|
O que torna o UMI transferível para diferentes robôs?
-
Desacoplamento de hardware via visão padronizada: Uma lente olho de peixe de 155° garante um campo visual eye-in-hand consistente, enquanto espelhos laterais rastreiam a profundidade estéreo e a abertura dos dedos. Isso elimina a necessidade de estruturas externas de câmera e neutraliza vieses visuais causados por diferentes estruturas de braço robótico.
-
Representação cinemática via trajetórias de 6-DoF: A Odometria Visual-Inercial rastreia a pose rígida da extremidade do efetuador, calculando ações relativas usando a posição atual da garra como origem espacial. Essa abordagem contorna as variações na anatomia do braço humano e nas coordenadas fixas do ambiente.
-
Adaptação de corpo via filtragem de viabilidade: Ao integrar o modelo URDF do robô-alvo, o UMI realiza Cinemática Inversa (IK) numérica e verificações de singularidade. Essa filtragem proativa remove automaticamente poses fora de alcance e previne violações de limite articular antes da execução.
-
Execução física via correspondência de latência: O alinhamento temporal explícito compensa os atrasos de inferência da política, sincronizando observação com execução. Traduzir os cálculos de IK em comandos articulares diretos elimina oscilações de trajetória entre diferentes malhas de controle.
Em conjunto, essas técnicas permitem operação imediata e pronta para uso em configurações de hardware que vão do UR5e e Franka a manipuladores como o AgileX PiPER e sistemas complexos de braço duplo.

Dados UMI transferíveis para diferentes braços robóticos
Da pesquisa UMI à coleta de dados físicos escalável e eficiente
Pika Pro: Um sistema prático de coleta de dados de robô baseado em UMI

|
Componente principal
|
Papel na coleta de dados
|
Especificações principais
|
|
Pika EGO
|
Visão em Primeira Pessoa (Ego-centric): Captura a visão em primeira pessoa do humano e suas interações com o ambiente, fornecendo contexto visual e semântico para o aprendizado do robô.
|
Sistema montado na cabeça
|
|
Pika Sense
|
Sensoriamento Multimodal e Rastreamento de Movimento: Captura dados de movimento espacial, visuais, de profundidade e inerciais para registrar a interação do humano com objetos e o ambiente.
|
Precisão: Posicionamento espacial de ±1,5 mm (sem obstrução)
Frequência: Saída de dados de 120 Hz
Integração: ROS1 / ROS2 / URDF
|
|
Pika Station Pro
|
Localização Espacial e Calibração: Fornece uma referência espacial estável para posicionamento preciso e rastreamento de trajetória durante a coleta de dados.
|
Dimensões: 215 × 220 × 257 mm
Autonomia da Bateria: Até 9 horas de operação contínua de rastreamento
|
|
Pika Package
|
Computação Móvel e Armazenamento de Dados: Fornece computação, energia e armazenamento portáteis para coleta sincronizada de dados multimodais em ambientes reais.
|
Processador: Intel i5-12450H
Memória/Armazenamento: 8 GB RAM / 2 TB de disco
Energia: 12V@10AH x 2 (Até 3 horas de autonomia)
Formato: 265 × 118 × 375 mm
|
Qual Método de Coleta de Dados de Robô Você Deve Usar?
|
Se o seu objetivo é...
|
Recomendação
|
|
Coletar trajetórias precisas e específicas do robô
|
Teleoperação
|
|
Treinar uma política fortemente vinculada a um robô específico
|
Teleoperação
|
|
Demonstrar a manipulação sem a presença do robô
|
UMI
|
|
Coletar demonstrações de manipulação transferíveis
|
UMI
|
|
Capturar a interação natural humano-ambiente
|
Coleta de dados egocêntrica
|
|
Coletar dados em diversos ambientes do mundo real
|
Egocêntrico / UMI
|
|
Construir um conjunto de dados de manipulação escalável
|
UMI
|
|
Construir um amplo conjunto de dados de IA incorporada
|
Combinar múltiplas abordagens
|
Teleoperação é mais forte quando a fidelidade de controle específica do robô importa UMI é bem adequado a demonstrações de manipulação portáteis e transferíveis Coleta de dados egocêntrica é promissor quando o objetivo é capturar a interação humana diversificada com o mundo físico em escala
Conclusão: Conectar a Coleta de Dados de Robôs e a Experiência Humana

Pika Pro, Sistema Escalável de Coleta de Dados de Robôs
FAQ
O que é UMI?
Por que a UMI é importante para a Inteligência Incorporada?
A UMI é compatível com diferentes braços robóticos?
Por que estão surgindo sistemas prontos para uso de coleta de dados de robôs?
-
Acesso Unificado à Frota: Integração e orquestração centralizadas em múltiplas unidades de gravação.
-
Sincronização de Tempo em Nível de Hardware: Sincronização submilissegundo entre visão egocêntrica, profundidade e rastreamento espacial.
-
Dados de Incorporação Coletados em Conjunto: Captura simultânea do contexto visual em primeira pessoa e da propriocepção do robô.
-
Gerenciamento do Ciclo de Vida dos Dados: Gravação, verificação de qualidade, reprodução e exportação integradas.
-
Padronização pronta para ML: Conversão direta em formatos de dados normalizados para aprendizado por imitação e políticas de difusão.


