Группа китайской оценки искусственного интеллекта SuperCLUE опубликовала сентябрьское издание своего рейтинга EmbodiedCLUE-VLA, который оценивает способность моделей ИИ выступать в роли когнитивного ядра робота, планируя и рассуждая в ходе выполнения физических задач.
Среди китайских разработок модели Qwen3.8-Max-0902 от Alibaba и Nebula-EmbodiedBrain от ZTE заняли первое место, получив идентичные общие баллы в размере 77.48.
Тестирование охватывает четыре ключевые области: базовая перцепция, которая делится на временную, объектную и пространственную перцепцию; визуальное рассуждение, включающее математическое, временное, пространственное и логическое рассуждение; взаимодействие и планирование, состоящее из планирования задач и планирования траектории; а также воплощенная безопасность, проверяющая соблюдение этических норм, физическую безопасность и защиту конфиденциальности.
SuperCLUE рассматривает модели, чьи показатели отличаются на один балл, как ничьи, и приводит международные модели лишь для справки вне основного рейтинга.
Как достигли лидеры рейтинга
Два лидера достигли одинакового общего результата разными путями. Модель Qwen3.8-Max-0902 показала наилучшие результаты среди китайских моделей в базовой перцепции (83.33) и визуальном рассуждении (84.72). В то же время Nebula-EmbodiedBrain набрала 97.92 по показателю воплощенной безопасности, опередив модель Alibaba, набравшую 89.58.
Обе модели получили одинаковый балл 39.29 в категории взаимодействия и планирования, однако модель ZTE продемонстрировала большую силу в планировании задач (64.29 против 28.57 у модели Alibaba), тогда как модель Alibaba была сильнее в планировании траектории (50 против 14.29).
Согласно отчету китайского технологического издания MyDrivers, модель Alibaba отличается способностью к пространственно-временной памяти, позволяющей ей запоминать незавершенную работу после прерывания задачи робота. Версия ZTE, напротив, ориентирована на развертывание на устройстве и адаптацию к аппаратному обеспечению робота, что делает ее более подходящей для работы на физических машинах. Ранее ZTE выпускала EmbodiedBrain 1.0 — модель зрения и языка для планирования воплощенных задач, с весами 7B и 32B, опубликованными на Hugging Face.
Далее в рейтинге следуют открытые модели с параметрами 10 миллиардов или меньше. MiMo-Embodied-7B от Xiaomi заняла второе место среди китайских моделей с результатом 56.95 и возглавила отдельный рейтинг SuperCLUE для моделей менее 10B. За ней последовала RynnBrain1.1-9B от Alibaba с баллом 50.33, затем RoboBrain2.5-8B-NV от BAAI с 46.36, и HY-Embodied-0.5 от Tencent, модель с 4B, набравшая 29.14. Оба лидера в этой группе являются закрытыми моделями, доступными через API.
Планирование остается самой слабой областью среди китайских разработчиков. Ни одна китайская модель не набрала выше 40 баллов в категории взаимодействия и планирования, а четыре открытых записи показали результат 14.29 или ниже. Среди моделей для сравнения GPT-6 Astra набрала 86.75 в целом, а Gemini-3.8-Flash — 82.12, в то время как Gemini-Robotics-ER-2-Preview, ориентированная на робототехнику, получила 70.86.
MyDrivers отметил, что по мере того как все больше компаний создают воплощенные мозги, рейтинги, основанные на различных тестовых наборах, часто дают противоречивые результаты, и что возможности этих моделей в значительной степени определят объем практической работы, которую смогут выполнять будущие роботы. SuperCLUE ранее публиковала выпуски этого рейтинга в январе и феврале 2026 года.
