Исследовательская команда MirroS представила AgentGarten — фреймворк, который предоставляет ИИ-агентам среду для взаимодействия, наблюдения и обучения. Согласно сообщению QbitAI от 9 октября, весь необходимый код, технический отчет и страница проекта доступны публично.
AgentGarten разделяет задачу симуляции мира на две части. Код отвечает за правила игры, физику, контакты и планировку, что обеспечивает явное состояние и предсказуемость каждого результата. Затем нейронный рендерер преобразует схематичный геометрический рисунок, экспортированный кодом (например, данные о глубине или нормалях поверхности с камеры агента), в реалистичный следующий кадр.
Команда утверждает, что такой подход позволяет избежать двух распространенных компромиссов: сцены, созданные с помощью игровых движков, которые требуют дорогостоящей художественной проработки для достижения реализма; и видеомодели мира, чья физика скрыта внутри нейронной сети и не может быть запрошена или изменена.
Рендерер генерирует видео короткими потоковыми сегментами, позволяя агенту действовать, видеть результат и принимать следующее решение. MirroS обучила систему методом, который они назвали Adversarial Forcing. Этот метод включает точное воспроизведение, чтобы градиенты достигали истории, сгенерированной моделью, а также дискриминатор, обученный на реальном видео, для предотвращения дрейфа и артефактов в виде сетки при длительных последовательностях действий.
Благодаря использованию пользовательских ядер Triton, графов CUDA и легковесного декодера, система поддерживает частоту более 30 кадров в секунду при разрешении 480p на одном графическом процессоре.
Для проверки процесса обучения команда повторно использовала игру в прятки из известного исследования 2019 года. В том исследовании обучение с подкреплением требовало около 25 миллионов эпизодов, прежде чем прячущиеся построят укрытия, и около 100 миллионов, прежде чем ищущие начнут использовать пандусы. В AgentGarten агенты видели только кадры от первого лица, которые были отрендерены, и управляли действиями через короткие программы на Python. После каждого раунда они анализировали свои игровые сессии и записывали уроки в «книгу правил», которую передавали следующему раунду. Прячущиеся начали строить укрытия уже к четвертому раунду, а искатели смогли преодолевать стены с помощью пандуса к десятому раунду.
Аналогичный цикл был запущен в четырех других средах в течение четырех раундов каждая. Показатели улучшились: оценка компаньонной собаки выросла с 13 до 19, время пересечения моста двумя автомобилями сократилось с 71 до 41 секунды, два пастушьих пса смогли собрать всех четырех овец вместо трех, а погрузчик для карьера завершил свою работу на 31 секунду раньше запланированного срока.
MirroS рассматривает эту работу как шаг к созданию агентов, которые постоянно совершенствуются в физических условиях, подчеркивая, что это исследовательская среда, а не готовый продукт для развертывания роботов.
