Modelo VPP2 da Robotera conquista o primeiro lugar no RoboDojo e alcança 58,5% de sucesso em tarefas com manipuladores reais ALOHA
Leia mais
Pandaily
pandaily.com

Modelo VPP2 da Robotera conquista o primeiro lugar no RoboDojo e alcança 58,5% de sucesso em tarefas com manipuladores reais ALOHA

A Robotera, que conta com o apoio da Universidade Tsinghua, anunciou que seu modelo de ponta mundial, VPP2, agora ocupa o primeiro lugar no RoboDojo. Este benchmark de simulação é supervisionado pelo MMLab da Universidade de Hong Kong e envolve quase 20 instituições acadêmicas.

De acordo com dados da QbitAI, o VPP2 demonstrou uma taxa média de sucesso de 32,26% e uma pontuação média de 39,26 em 42 tarefas com dois manipuladores RoboDojo. Essas tarefas testam aspectos como generalização, manipulação precisa, tarefas de longo horizonte, memória e instruções de vocabulário aberto. O modelo também ficou em primeiro lugar nas categorias de generalização, precisão e memória.

A Robotera enfatiza que o alcance desses resultados foi realizado sem o uso de dados de treinamento adicionais ou *add-ons*, como autoaperfeiçoamento recursivo baseado em agentes, utilizando exclusivamente o conjunto de dados padrão. O modelo de controle mais forte mencionado em sua pesquisa — GPT-6-Astra após treinamento adicional — obteve resultados de 22,48% e 28,97. A classificação corresponde aos números apresentados no artigo científico. Anteriormente, a empresa Simate havia anunciado seu sucesso com o sistema Simate-beta no RoboDojo.

O modelo VPP2 visa resolver uma fraqueza conhecida dos modelos de ponta mundial: se a previsão de vídeo estiver incorreta, a ação segue essa previsão. O processo de treinamento na Robotera é dividido em três etapas. A primeira etapa é o pré-treinamento de vídeo em nível de eventos, baseado na fonte aberta Wan2.1-I2V-14B da Alibaba. Ele treina o modelo para prever todo o processo de manipulação do início ao fim, usando clipes detalhadamente anotados de robôs, pessoas e materiais de vídeo gerais.

Em seguida, a previsão é reduzida a segmentos fixos de oito segundos e destilada em um único passo que leva cerca de 0,12 segundos. A terceira etapa envolve o uso do Action DiT com 0,9 bilhões de parâmetros, que aprende a traduzir previsões em movimento, enquanto o modelo de vídeo permanece congelado e se adapta apenas através de LoRA. A latência total para o bloco de ação é de aproximadamente 0,22 segundos.

Ao ser testado em um robô real de dois manipuladores ALOHA, o VPP2 mostrou uma média de 58,5% em 10 tipos de tarefas sem pré-treinamento, incluindo pegar, colocar, empilhar, dobrar e despejar. Isso é superior aos 40% do pi0.5 da Physical Intelligence, e o modelo foi o melhor em nove dessas tarefas. Ele obteve 45,0% no LIBERO-Pro e 63,9% no LIBERO-OOD. A adição de um modelo de visão e linguagem como planejador de alto nível aumentou os resultados das tarefas selecionadas de longo horizonte do RoboDojo de 27,6% para 57,6%.

A Robotera já utiliza robôs em mais de 10 centros logísticos em cinco províncias e cidades em parceria com empresas como China Post e SF Express, embora isso não signifique uma implementação completa do VPP2. O código do modelo está disponível publicamente no GitHub.

Histórias semelhantes

Plataforma de teste VA-Bench da Universidade de Tecnologia de Dalian mostra que os melhores modelos multimodais completam apenas metade das tarefas de robótica
Leia mais
pandaily.com

Plataforma de teste VA-Bench da Universidade de Tecnologia de Dalian mostra que os melhores modelos multimodais completam apenas metade das tarefas de robótica

Um grupo de pesquisa da Universidade de Tecnologia de Dalian apresentou o VA-Bench, um novo benchmark projetado para testar a capacidade de grandes modelos de linguagem multimodais universais de converter informações visuais em ações bem-sucedidas de um braço robótico.

Entre as doze configurações testadas, o melhor modelo, Qwen3.8-max da Alibaba, conseguiu completar em média 53,93% das tarefas. Isso indica que os modelos capazes de 'entender' a cena ainda enfrentam dificuldades na execução confiável das ações correspondentes.

A descrição do benchmark foi publicada em um artigo no arXiv (2609.19554) e na publicação chinesa Sina Tech. O VA-Bench avalia o ciclo completo do processo: observação, raciocínio, ação e correção. Antes de cada teste, o modelo visualiza um vídeo de demonstração bem-sucedida, mas não recebe coordenadas de objetos, trajetórias de especialistas ou parâmetros de ação precisos.

Durante o teste, o modelo pode mudar os ângulos da câmera autonomamente, o que aumenta o número de passos de interação, e deve fornecer comandos específicos: deslocamentos em milímetros em cada eixo, ângulos de rotação e instruções para abrir ou fechar a garra. Um controlador fixo executa estritamente as instruções fornecidas pelo modelo.

Escopo e Estrutura do Teste

O benchmark abrange 14 tipos de tarefas de manipulação, incluindo 11 tarefas com um braço e três tarefas com dois braços. Cada tarefa inclui 20 cenas fisicamente verificadas em simulação de física, totalizando 280 cenas base. Além disso, foram adicionadas variações de geometria e layout, bem como um percurso com cinco objetos que exige uma execução prolongada. Cada configuração de modelo foi executada três vezes.

Os principais modelos alcançaram 100% de precisão na localização de alvos e 99,6%–100% na compreensão da manipulação necessária, mas o sucesso geral da tarefa permaneceu em cerca de metade. Os modelos Opus-5 e GPT-5.6-sol, apresentados no exterior, seguiram o Qwen3.8-max, mostrando resultados de 52,86% e 51,55%, respectivamente. Os autores observam que os três líderes estão dentro de 2,38 pontos percentuais e não fazem declarações sobre classificação confiável. A porcentagem de conclusão das subtarefas variou de 65,9% a 68,6%, indicando que muitos falhos ocorrem após progresso parcial. Todas as outras condições apresentaram um resultado de 23,10% ou inferior.

Principais Problemas Identificados

Foram identificadas duas lacunas principais. O Qwen3.8-max conseguiu detectar erros em 73,6% dos casos, mas corrigiu-os online apenas em 46,7% dos casos. Sua eficácia foi de 65,61% em tarefas de um braço, mas apenas 11,11% em tarefas de dois braços, que exigem a distribuição de objetos entre cada braço e a coordenação de sua disposição mútua.

A observação ativa mostrou ser um fator mais significativo do que a presença de câmeras adicionais. Em uma análise comparativa, o Qwen3.8-max obteve sucesso em 57,50% das 280 cenas quando escolhia os pontos de vista, em comparação com 27,86% quando lhe eram fornecidos cinco pontos de vista fixos. Além disso, todos os quatro modelos testados recusaram-se a participar do teste sem observação ativa.

A alteração na forma de objetos, contêineres ou no layout, mantendo a mesma tarefa, reduziu o sucesso de um dos modelos de referência em mais de 30 pontos — de 80,00% para 47,86%. Ao mesmo tempo, o Qwen3.8-max reduziu seu índice de 77,86% para 67,86%. No percurso de execução prolongada, o Qwen3.8-max posicionou 61 de 100 objetos, mas nenhum modelo concluiu um episódio rigoroso.

Este benchmark difere da classificação 'embodied brain' SuperCLUE, publicada esta semana, porque o VA-Bench mede se os julgamentos de percepção, raciocínio e planejamento levam a uma ação física bem-sucedida, ao contrário do SuperCLUE, que avalia esses aspectos em si.

Popular