O grupo chinês de avaliação de inteligência artificial SuperCLUE publicou a edição de setembro do seu ranking EmbodiedCLUE-VLA, que avalia a capacidade dos modelos de IA de atuar como núcleo cognitivo de um robô, planejando e raciocinando durante a execução de tarefas físicas.
Entre os desenvolvimentos chineses, os modelos Qwen3.8-Max-0902 da Alibaba e Nebula-EmbodiedBrain da ZTE ocuparam o primeiro lugar, obtendo pontuações gerais idênticas de 77,48.
O teste abrange quatro áreas principais: percepção básica, que se divide em percepção temporal, de objetos e espacial; raciocínio visual, que inclui raciocínio matemático, temporal, espacial e lógico; interação e planejamento, composto por planejamento de tarefas e planejamento de trajetória; e segurança incorporada, que verifica o cumprimento de normas éticas, segurança física e proteção de privacidade.
A SuperCLUE considera modelos cujas pontuações diferem em um ponto como empate e apresenta modelos internacionais apenas para referência fora do ranking principal.
Como os líderes do ranking alcançaram
Os dois líderes alcançaram o mesmo resultado geral por caminhos diferentes. O modelo Qwen3.8-Max-0902 demonstrou os melhores resultados entre os modelos chineses em percepção básica (83,33) e raciocínio visual (84,72). Ao mesmo tempo, o Nebula-EmbodiedBrain obteve 97,92 na métrica de segurança incorporada, superando o modelo da Alibaba, que alcançou 89,58.
Ambos os modelos receberam a mesma pontuação de 39,29 na categoria interação e planejamento, mas o modelo da ZTE demonstrou maior força no planejamento de tarefas (64,29 contra 28,57 do modelo da Alibaba), enquanto o modelo da Alibaba foi mais forte no planejamento de trajetória (50 contra 14,29).
De acordo com o relatório da publicação tecnológica chinesa MyDrivers, o modelo da Alibaba se destaca pela capacidade de memória espaço-temporal, permitindo-lhe lembrar trabalhos incompletos após a interrupção de uma tarefa do robô. A versão da ZTE, por outro lado, é orientada para implantação em dispositivos e adaptação ao hardware do robô, tornando-a mais adequada para operar em máquinas físicas. Anteriormente, a ZTE lançou o EmbodiedBrain 1.0 — um modelo de visão e linguagem para planejamento de tarefas incorporadas, com pesos de 7B e 32B, publicado no Hugging Face.
Em seguida no ranking, seguem modelos abertos com 10 bilhões de parâmetros ou menos. O MiMo-Embodied-7B da Xiaomi ficou em segundo lugar entre os modelos chineses com um resultado de 56,95 e liderou um ranking separado da SuperCLUE para modelos com menos de 10B. Foi seguido pelo RynnBrain1.1-9B da Alibaba com 50,33 pontos, depois pelo RoboBrain2.5-8B-NV da BAAI com 46,36, e HY-Embodied-0.5 da Tencent, um modelo de 4B, que obteve 29,14. Ambos os líderes neste grupo são modelos fechados, acessíveis via API.
O planejamento continua sendo a área mais fraca entre os desenvolvedores chineses. Nenhum modelo chinês obteve mais de 40 pontos na categoria interação e planejamento, e quatro entradas abertas mostraram um resultado de 14,29 ou inferior. Entre os modelos de comparação, o GPT-6 Astra obteve 86,75 no geral, e o Gemini-3.8-Flash — 82,12, enquanto o Gemini-Robotics-ER-2-Preview, focado em robótica, recebeu 70,86.
A MyDrivers observou que, à medida que mais empresas criam cérebros incorporados, os rankings baseados em diferentes conjuntos de testes frequentemente fornecem resultados contraditórios, e que as capacidades desses modelos determinarão em grande parte o volume de trabalho prático que os futuros robôs poderão realizar. A SuperCLUE publicou anteriormente edições deste ranking em janeiro e fevereiro de 2026.

