Li Auto представила трилогию воплощенного ИИ: ME-Brain-1.0, ME-U0 и Edge ME-VLM
Подробнее
Pandaily
pandaily.com

Li Auto представила трилогию воплощенного ИИ: ME-Brain-1.0, ME-U0 и Edge ME-VLM

Команда по фундаментальным моделям Li Auto 22 сентября обнародовала трилогию воплощенного искусственного интеллекта, состоящую из системы ME-Brain-1.0, унифицированной модели понимания и генерации действий в мире MachEmbodied-U0 (ME-U0) и когнитивных моделей MachEmbodied-VLM (ME-VLM). Официальное английское наименование этих разработок — Li Auto / MachEmbodied. Основной акцент в данном обзоре сделан на архитектуре системы и моделей — памяти, познании и действии, а не на маркетинге продуктов для электромобилей.

Согласно техническому блогу ME-Brain-1.0, данная система объединяет Эволюционную Память (Evolvable Memory), Когнитивное Ядро (Cognitive Core) и Модель Действия, управляемую событиями, в цикл, включающий исполнение, фиксацию опыта и обновление навыков. Когнитивное Ядро доступно в варианте MoE с 35B-A3B параметров и в компактном варианте для периферийных устройств (edge) с 4B параметров. В лабораторных испытаниях крупное ядро показало средний результат около 70.9 по наборам данных, связанным с воплощенными системами, и 72.5 по наборам данных агентов, при этом версия с 4B параметрами заняла второе место в сравнении с другими компаниями.

Эволюционная Память и связанные с ней модули функционируют на периферийном SoC M100 от Li Auto для генерации и извлечения памяти непосредственно на устройстве. ME-VLM представляет собой путь Когнитивного Ядра, где за счет квантования W4A8 и сжатия токенов время предварительной загрузки (Prefill latency) на M100 было сокращено примерно с 400 мс до 188 мс.

Модель ME-U0 была предварительно обучена на приблизительно 4200 часах данных, отобранных из более крупных наборов данных роботов и данных от первого лица. Согласно метрикам компании, модель достигает среднего успеха 99.1% на стандартном LIBERO, 81.8% на LIBERO-Plus без специальной адаптации и показатель процесса 17.66 на RoboDojo-Sim среди участвующих моделей действий в мире. Архитектура использует двухэкспертных модуля для понимания и генерации с многоскоростным вращательным кодированием позиции, что обеспечивает временное согласование латентных представлений зрения и токенов действий.

В сторонних публикациях, включая освещение от Robot Forward, переизданное Phoenix Tech, отмечаются видимые паузы захвата, периодические ошибки при захвате и незавершенные задачи в открытых сценариях, даже там, где скриптованные сцены проходят успешно. Эти замечания являются полезными дополнениями к лабораторным таблицам лидеров. Пока что бенчмарки остаются данными, предоставленными Li Auto, до тех пор, пока внешние лаборатории не воспроизведут их результаты. Краткосрочный сигнал заключается в наличии упакованного стека памяти-познание-действие с документированным путем на периферийном SoC, а не в презентации единого шасси.

Похожие сюжеты

Стартап EBKernel представил модель Cog-WM 1.0, вдохновленную мозгом, для когнитивного моделирования мира
Подробнее
pandaily.com

Стартап EBKernel представил модель Cog-WM 1.0, вдохновленную мозгом, для когнитивного моделирования мира

Шанхайский стартап EBKernel представил Cog-WM 1.0 на сессии по воплощенному интеллекту, вдохновленному мозгом, в рамках Форума инноваций Пуцян в 2026 году. Компания позиционирует этот релиз как когнитивную модель мира, построенную на прогнозировании в латентном пространстве, а не на воспроизведении пикселей.

Согласно заявлению компании, данная архитектура заимствует организационные концепции из человеческих когнитивных карт, такие как избирательное обновление памяти, кодирование, обусловленное целью, и прогнозирование на нескольких горизонтах. Эти идеи сочетаются с целевой функцией совместного встраивания в стиле JEPA, позволяя роботам планировать, используя абстрактные пространственные и состоятельные признаки, вместо реконструкции сырых кадров.

В части навигации, модель Cog-WM Nav 1.0 была протестирована без использования предварительно созданной карты. На подмножестве HM3D-ObjectNav EBKernel сообщила об увеличении показателя успеха с 78,50% до 86,89% по сравнению с базовой линией BSC-Nav, опубликованной в Nature Communications. Это представляет собой абсолютный прирост в 8,39 пункта (примерно 10,7% относительно), а показатель SPL увеличился с 47,70 до 48,35.

Навигационный компонент сохраняет явную пространственную память и прогнозирует подцели для исследования в латентном пространстве. Затем он балансирует между семантикой цели и стоимостью пути, что особенно полезно, когда цель находится вне текущего поля зрения, и роботу необходимо решить, куда смотреть дальше.

Манипуляционная ветвь, Cog-WM Manip 1.0, обучает многомасштабное прогнозирование состояния и опыт, модулированный значением, обеспечивая связь между эффектами действий на коротком горизонте и прогрессом задачи на более длительном отрезке. При использовании единого протокола воспроизведения EBKernel утверждает, что модель превосходит массово предварительно обученные базовые модели типа pi0.5 примерно на 16% по трем основным наборам данных для манипуляций, включая более сложные настройки RoboTwin 2.0.

Анализ влияния компонентов на LIBERO-Plus показал аддитивный эффект: политика сама по себе достигла почти 80%, локальное прогнозирование — 81,6%, многогоризонтное прогнозирование — 82,0%, а полная система — 84,6%.

Компания заявляет о возможностях развертывания, которые охватывают гуманоидов на колесах и четвероногих для навигации без карт, планирования маршрута, извлечения пространственно-временной памяти, пространственного ответа на вопросы (QA) и поиска объектов. Манипуляция была проверена на гуманоидных телах на колесах, а навигация четвероногих отмечена на клиентских объектах для инспекции или патрулирования.

EBKernel, основанная в середине 2025 года, продвигает тезис о продукте, заключающийся в обучении в течение всей жизни с низкой потребностью в данных и высокой обобщающей способностью. Однако независимые показатели долговечности на открытом воздухе и результаты в поле на длинных горизонтах пока остаются ограниченными рамками внутренних бенчмарков компании, поэтому лабораториям рекомендуется рассматривать опубликованные показатели SR и изменения в манипуляции как основной набор для сравнения до появления работ третьих сторон.

Популярное