MirroS lança AgentGarten — um framework para treinar agentes de IA em mundos de código simulados
Leia mais
Pandaily
pandaily.com

MirroS lança AgentGarten — um framework para treinar agentes de IA em mundos de código simulados

A equipe de pesquisa da MirroS apresentou o AgentGarten, um framework que fornece aos agentes de IA um ambiente para interação, observação e aprendizado. De acordo com um comunicado da QbitAI em 9 de outubro, todo o código necessário, relatório técnico e página do projeto estão disponíveis publicamente.

O AgentGarten divide a tarefa de simulação de mundo em duas partes. O código é responsável pelas regras do jogo, física, contatos e layout, garantindo um estado explícito e previsibilidade de cada resultado. Em seguida, um renderizador neural transforma o desenho geométrico esquemático exportado pelo código (por exemplo, dados de profundidade ou normais de superfície da câmera do agente) em um quadro realista subsequente.

A equipe afirma que essa abordagem permite evitar dois compromissos comuns: cenas criadas com motores de jogos que exigem um trabalho artístico caro para alcançar o realismo; e modelos de vídeo do mundo cuja física está oculta dentro da rede neural e não pode ser solicitada ou alterada.

O renderizador gera vídeos em segmentos de fluxo curtos, permitindo que o agente aja, veja o resultado e tome a próxima decisão. A MirroS treinou o sistema usando um método que eles chamaram de Adversarial Forcing. Este método inclui reprodução precisa para que os gradientes atinjam o histórico gerado pelo modelo, bem como um discriminador treinado em vídeo real para prevenir desvios e artefatos em forma de grade em sequências longas de ações.

Graças ao uso de núcleos Triton personalizados, grafos CUDA e um decodificador leve, o sistema suporta uma taxa superior a 30 quadros por segundo em resolução 480p em uma única GPU.

Para testar o processo de treinamento, a equipe reutilizou o jogo de esconde-esconde de um estudo conhecido de 2019. Nesse estudo, o aprendizado por reforço exigiu cerca de 25 milhões de episódios antes que os escondidos construíssem esconderijos, e cerca de 100 milhões antes que os procuradores começassem a usar rampas. No AgentGarten, os agentes viam apenas quadros de primeira pessoa que foram renderizados e controlavam as ações através de pequenos programas em Python. Após cada rodada, eles analisavam suas sessões de jogo e registravam lições no 'livro de regras', que era passado para a próxima rodada. Os escondidos começaram a construir esconderijos já na quarta rodada, e os procuradores conseguiram atravessar paredes com a ajuda de uma rampa até a décima rodada.

Um ciclo semelhante foi iniciado em outras quatro ambientes durante quatro rodadas cada. As métricas melhoraram: a pontuação do cão companheiro aumentou de 13 para 19, o tempo de travessia da ponte por dois carros diminuiu de 71 para 41 segundos, dois cães pastores conseguiram reunir todas as quatro ovelhas em vez de três, e o carregador para a pedreira concluiu seu trabalho 31 segundos antes do prazo previsto.

A MirroS considera este trabalho um passo em direção à criação de agentes que se aprimoram continuamente em condições físicas, enfatizando que este é um ambiente de pesquisa e não um produto pronto para implantação de robôs.

Histórias semelhantes

Huawei lança código-fonte do AgentOS — plataforma para agentes corporativos, enxames e controle multiusuário
Leia mais
pandaily.com

Huawei lança código-fonte do AgentOS — plataforma para agentes corporativos, enxames e controle multiusuário

openJiuwen, uma plataforma de agentes de IA de código aberto desenvolvida pelos laboratórios da Huawei em 2012, Huawei Cloud e outras equipes da Huawei em colaboração com universidades e empresas, lançou e disponibilizou publicamente a versão corporativa do AgentOS.

Este projeto visa resolver os problemas que surgem na transição de exemplos demonstrativos de agentes para uso industrial real. Tais problemas incluem a complexidade de coordenar longas cadeias de tarefas por múltiplos agentes, a perda de experiência entre execuções, o aumento dos custos de computação, bem como a necessidade de garantir permissões de dados, isolamento e capacidade de recuperação exigidas pelas empresas antes que elas confiem aos agentes tarefas reais.

O código está disponível como AgentOS for Enterprise no GitHub e AtomGit sob a licença Apache 2.0. O repositório descreve quatro componentes principais: runtime de agente distribuído, agentes para trabalho e codificação jiuwenswarm, sandbox de agente Conch e gateway de acesso ao agente.

O sistema suporta implantação tanto em uma única máquina quanto em um cluster, permitindo sua compilação e implantação com um único comando, e funciona nos sistemas operacionais openEuler ou Ubuntu.

Mecanismos de coordenação e autodesenvolvimento

Em termos de coordenação, o AgentOS utiliza orquestração de fluxos de trabalho e colaboração de enxames para dividir tarefas, atribuir papéis e executar etapas em paralelo, como pesquisa, análise e escrita, sendo que os humanos podem intervir em momentos críticos de tomada de decisão. Quanto ao autodesenvolvimento, a plataforma aplica rastreamento de execução, feedback do usuário e memória para melhorar habilidades e modelos de interação dos agentes, transformando soluções bem-sucedidas em capacidades reutilizáveis.

O runtime também visa aumentar a eficiência do uso de recursos computacionais através do design conjunto de hardware e software, planejamento de recursos e otimização de inferência.

Para garantir a segurança, são previstos isolamento multiusuário, sandboxes protegidos, gerenciamento de permissões e guardrails que controlam o acesso a dados e chamadas de ferramentas, além de uma função de recuperação de falhas que permite continuar a execução de tarefas longas.

Chamadas de modelos, chamadas de ferramentas e gerenciamento de memória são empacotados como plugins que são carregados sob demanda. Para desenvolvedores, existem cinco tipos de ativos — habilidades, conectores, plugins, especialistas e equipes de especialistas — que podem ser combinados, publicados, obtidos ou compartilhados através do Agentic Hub, permitindo que parceiros empacotem métodos setoriais e integrações de sistemas como componentes reutilizáveis.

Este software também serve como base para implementação de hardware. No evento Huawei Connect 2026, a Huawei apresentou uma plataforma de aceleração de agentes de código aberto para dispositivos universais construídos com base no Jiuwen AgentOS. Esta plataforma combina um gateway de agente unificado, um runtime distribuído e um ambiente de trabalho WorkSwarm para escritório e codificação, incluindo um SystemAgent integrado para configuração e gerenciamento com um clique.

De acordo com as informações de lançamento, as empresas podem concluir uma implantação totalmente privada em questão de horas e, em seguida, conectar sistemas de negócios existentes, bases de conhecimento locais e modelos setoriais através de interfaces abertas e plugins.

Popular