Модель VPP2 от Robotera заняла первое место в RoboDojo и показала 58,5% успеха в задачах на реальных манипуляторах ALOHA
Подробнее
Pandaily
pandaily.com

Модель VPP2 от Robotera заняла первое место в RoboDojo и показала 58,5% успеха в задачах на реальных манипуляторах ALOHA

Компания Robotera, которая имеет поддержку Университета Цинхуа, объявила, что ее модель мирового действия VPP2 теперь занимает первое место в RoboDojo. Этот симуляционный бенчмарк курируется MMLab из Университета Гонконга и включает почти 20 академических учреждений.

Согласно данным QbitAI, VPP2 продемонстрировала средний процент успешности на уровне 32,26% и средний балл 39,26 в рамках 42 задач с двумя манипуляторами RoboDojo. Эти задачи проверяют такие аспекты, как обобщение, точное манипулирование, задачи с длинным горизонтом, память и инструкции с открытым словарным запасом. Модель также заняла первое место в категориях обобщения, точности и памяти.

Robotera подчеркивает, что достижение этих показателей было реализовано без использования дополнительных обучающих данных или надстроек, таких как рекурсивное самосовершенствование на основе агентов, используя исключительно стандартный набор данных. Наиболее сильная контрольная модель, упомянутая в их исследовании — GPT-6-Astra после дополнительного обучения — показала результаты 22,48% и 28,97. Рейтинг соответствует цифрам, представленным в научной работе. Ранее компания Simate заявляла о своем успехе с системой Simate-beta в RoboDojo.

Модель VPP2 направлена на устранение известной слабости моделей мирового действия: если видеопрогноз оказывается неверным, действие следует этому прогнозу. Процесс обучения в Robotera разделен на три этапа. Первый этап — предварительное обучение видео на уровне событий, основанное на открытом источнике Wan2.1-I2V-14B от Alibaba. Он обучает модель предсказывать весь процесс манипуляции от начала до конца, используя детально аннотированные клипы от роботов, людей и общих видеоматериалов.

Далее, прогноз сокращается до фиксированных восьмисекундных отрезков и дистиллируется в один шаг, который занимает около 0,12 секунды. Третий этап включает использование Action DiT с 0,9 миллиарда параметров, который учится преобразовывать прогнозы в движение, в то время как видеомодель остается замороженной и адаптируется только через LoRA. Общая задержка для блока действия составляет примерно 0,22 секунды.

При тестировании на реальном двухманипуляторном роботе ALOHA, VPP2 показала в среднем 58,5% по 10 типам задач без предварительного обучения, включая подбор, размещение, штабелирование, складывание и наливание. Это выше, чем 40% у pi0.5 от Physical Intelligence, и модель была лучшей в девяти из этих задач. Она набрала 45,0% на LIBERO-Pro и 63,9% на LIBERO-OOD. Добавление модели зрения и языка в качестве высокоуровневого планировщика повысило результаты выбранных задач с длинным горизонтом RoboDojo с 27,6% до 57,6%.

Robotera уже использует роботов в более чем 10 логистических центрах в пяти провинциях и городах в партнерстве с такими компаниями, как China Post и SF Express, хотя это не означает полномасштабного внедрения VPP2. Код модели доступен в открытом доступе на GitHub.

Популярное