A equipe de pesquisa da MirroS apresentou o AgentGarten, um framework que fornece aos agentes de IA um ambiente para interação, observação e aprendizado. De acordo com um comunicado da QbitAI em 9 de outubro, todo o código necessário, relatório técnico e página do projeto estão disponíveis publicamente.
O AgentGarten divide a tarefa de simulação de mundo em duas partes. O código é responsável pelas regras do jogo, física, contatos e layout, garantindo um estado explícito e previsibilidade de cada resultado. Em seguida, um renderizador neural transforma o desenho geométrico esquemático exportado pelo código (por exemplo, dados de profundidade ou normais de superfície da câmera do agente) em um quadro realista subsequente.
A equipe afirma que essa abordagem permite evitar dois compromissos comuns: cenas criadas com motores de jogos que exigem um trabalho artístico caro para alcançar o realismo; e modelos de vídeo do mundo cuja física está oculta dentro da rede neural e não pode ser solicitada ou alterada.
O renderizador gera vídeos em segmentos de fluxo curtos, permitindo que o agente aja, veja o resultado e tome a próxima decisão. A MirroS treinou o sistema usando um método que eles chamaram de Adversarial Forcing. Este método inclui reprodução precisa para que os gradientes atinjam o histórico gerado pelo modelo, bem como um discriminador treinado em vídeo real para prevenir desvios e artefatos em forma de grade em sequências longas de ações.
Graças ao uso de núcleos Triton personalizados, grafos CUDA e um decodificador leve, o sistema suporta uma taxa superior a 30 quadros por segundo em resolução 480p em uma única GPU.
Para testar o processo de treinamento, a equipe reutilizou o jogo de esconde-esconde de um estudo conhecido de 2019. Nesse estudo, o aprendizado por reforço exigiu cerca de 25 milhões de episódios antes que os escondidos construíssem esconderijos, e cerca de 100 milhões antes que os procuradores começassem a usar rampas. No AgentGarten, os agentes viam apenas quadros de primeira pessoa que foram renderizados e controlavam as ações através de pequenos programas em Python. Após cada rodada, eles analisavam suas sessões de jogo e registravam lições no 'livro de regras', que era passado para a próxima rodada. Os escondidos começaram a construir esconderijos já na quarta rodada, e os procuradores conseguiram atravessar paredes com a ajuda de uma rampa até a décima rodada.
Um ciclo semelhante foi iniciado em outras quatro ambientes durante quatro rodadas cada. As métricas melhoraram: a pontuação do cão companheiro aumentou de 13 para 19, o tempo de travessia da ponte por dois carros diminuiu de 71 para 41 segundos, dois cães pastores conseguiram reunir todas as quatro ovelhas em vez de três, e o carregador para a pedreira concluiu seu trabalho 31 segundos antes do prazo previsto.
A MirroS considera este trabalho um passo em direção à criação de agentes que se aprimoram continuamente em condições físicas, enfatizando que este é um ambiente de pesquisa e não um produto pronto para implantação de robôs.

