A equipe de modelos fundamentais da Li Auto divulgou em 22 de setembro uma trilogia de inteligência artificial incorporada, composta pelo sistema ME-Brain-1.0, um modelo unificado de compreensão e geração de ações no mundo MachEmbodied-U0 (ME-U0) e modelos cognitivos MachEmbodied-VLM (ME-VLM). O nome oficial em inglês desses desenvolvimentos é Li Auto / MachEmbodied. O foco principal desta análise está na arquitetura do sistema e dos modelos — memória, cognição e ação — e não no marketing de veículos elétricos.
De acordo com o blog técnico do ME-Brain-1.0, este sistema combina Memória Evolutiva (Evolvable Memory), Núcleo Cognitivo (Cognitive Core) e um Modelo de Ação orientado por eventos em um ciclo que inclui execução, registro de experiência e atualização de habilidades. O Núcleo Cognitivo está disponível na variante MoE com 35B-A3B parâmetros e em uma versão compacta para dispositivos de borda (edge) com 4B parâmetros. Em testes laboratoriais, o núcleo grande obteve uma pontuação média de cerca de 70.9 nos conjuntos de dados relacionados a sistemas incorporados e 72.5 nos conjuntos de dados de agentes, enquanto a versão de 4B parâmetros ficou em segundo lugar em comparação com outras empresas.
A Memória Evolutiva e seus módulos associados funcionam no SoC de borda M100 da Li Auto para gerar e recuperar memória diretamente no dispositivo. O ME-VLM representa um caminho do Núcleo Cognitivo, onde, graças à quantização W4A8 e compressão de tokens, o tempo de pré-carregamento (Prefill latency) no M100 foi reduzido de aproximadamente 400 ms para 188 ms.
O modelo ME-U0 foi pré-treinado em aproximadamente 4200 horas de dados selecionados de grandes conjuntos de dados de robótica e dados em primeira pessoa. De acordo com as métricas da empresa, o modelo atinge um sucesso médio de 99.1% no padrão LIBERO, 81.8% no LIBERO-Plus sem adaptação especial e uma pontuação de processo de 17.66 no RoboDojo-Sim entre os modelos de ação no mundo participantes. A arquitetura utiliza módulos de dois especialistas para compreensão e geração com codificação rotacional de alta velocidade da posição, garantindo o alinhamento temporal das representações visuais latentes e dos tokens de ação.
Publicações externas, incluindo cobertura da Robot Forward republicada pela Phoenix Tech, notam pausas visíveis de captura, erros periódicos de captura e tarefas incompletas em cenários abertos, mesmo onde cenas roteirizadas são bem-sucedidas. Esses comentários são adições úteis às tabelas de classificação laboratoriais. Por enquanto, os benchmarks permanecem como dados fornecidos pela Li Auto, até que laboratórios externos reproduzam seus resultados. O sinal de curto prazo é a existência de um stack empacotado de memória-cognição-ação com um caminho documentado no SoC de borda, e não a apresentação de um chassi único.

