चीनी आर्टिफिशियल इंटेलिजेंस मूल्यांकन समूह सुपरक्ल्यू ने अपने एम्बोडीडक्ल्यू-वीएलए की सितंबर अंक प्रकाशित किए हैं, जो एआई मॉडल की रोबोट के संज्ञानात्मक कोर के रूप में कार्य करने की क्षमता का मूल्यांकन करता है, जिसमें भौतिक कार्यों को पूरा करते समय योजना बनाना और तर्क करना शामिल है।
चीनी विकासों में, अलीबाबा का Qwen3.8-Max-0902 और ZTE का Nebula-EmbodiedBrain पहले स्थान पर रहे, जिन्होंने 77.48 के समान समग्र स्कोर प्राप्त किए।
परीक्षण चार प्रमुख क्षेत्रों को कवर करते हैं: आधारभूत धारणा, जिसे अस्थायी, वस्तुगत और स्थानिक धारणा में विभाजित किया गया है; विज़ुअल रीजनिंग, जिसमें गणितीय, अस्थायी, स्थानिक और तार्किक तर्क शामिल है; इंटरैक्शन और प्लानिंग, जिसमें कार्य योजना और पथ योजना शामिल है; और एम्बोडीड सेफ्टी, जो नैतिक मानदंडों, भौतिक सुरक्षा और गोपनीयता की सुरक्षा का परीक्षण करती है।
सुपरक्ल्यू उन मॉडलों को टाई मानता है जिनके स्कोर एक बिंदु से भिन्न होते हैं, और मुख्य रैंकिंग से बाहर केवल संदर्भ के लिए अंतरराष्ट्रीय मॉडलों को सूचीबद्ध करता है।
रैंकिंग में लीडर्स ने कैसे हासिल किया
दोनों लीडर्स ने अलग-अलग तरीकों से समान समग्र परिणाम प्राप्त किए। Qwen3.8-Max-0902 ने आधारभूत धारणा (83.33) और विज़ुअल रीजनिंग (84.72) में चीनी मॉडलों में सर्वश्रेष्ठ परिणाम दिखाए। वहीं, Nebula-EmbodiedBrain ने एम्बोडीड सेफ्टी के मानदंड पर 97.92 अंक प्राप्त किए, जिसने अलीबाबा के मॉडल (89.58) को पीछे छोड़ दिया।
दोनों मॉडलों ने इंटरैक्शन और प्लानिंग श्रेणी में समान 39.29 अंक प्राप्त किए, हालांकि ZTE के मॉडल ने कार्य योजना (अलीबाबा के 28.57 की तुलना में 64.29) में अधिक ताकत दिखाई, जबकि अलीबाबा का मॉडल पथ योजना (14.29 की तुलना में 50) में मजबूत था।
चीनी प्रौद्योगिकी प्रकाशन MyDrivers के अनुसार, अलीबाबा का मॉडल स्थानिक-अस्थायी स्मृति की क्षमता से अलग है, जो इसे रोबोट के कार्य बाधित होने के बाद अधूरे काम को याद रखने की अनुमति देता है। इसके विपरीत, ZTE का संस्करण डिवाइस पर तैनाती और रोबोट हार्डवेयर के अनुकूलन पर केंद्रित है, जो इसे भौतिक मशीनों पर काम करने के लिए अधिक उपयुक्त बनाता है। ZTE ने पहले EmbodiedBrain 1.0 जारी किया था - एम्बोडीड कार्यों की योजना बनाने के लिए एक दृष्टि और भाषा मॉडल, जिसके 7B और 32B भार Hugging Face पर प्रकाशित हुए थे।
रैंकिंग में आगे खुले मॉडल 10 बिलियन या उससे कम पैरामीटर वाले हैं। Xiaomi का MiMo-Embodied-7B चीनी मॉडलों में दूसरे स्थान पर रहा, जिसका परिणाम 56.95 था, और इसने 10B से कम मॉडल के लिए सुपरक्ल्यू की एक अलग रैंकिंग का नेतृत्व किया। इसके बाद अलीबाबा का RynnBrain1.1-9B 50.33 अंकों के साथ आया, फिर BAAI का RoboBrain2.5-8B-NV 46.36 के साथ, और Tencent का HY-Embodied-0.5, जो 4B का मॉडल है, 29.14 अंक के साथ आया। इस समूह के दोनों लीडर एपीआई के माध्यम से उपलब्ध क्लोज्ड मॉडल हैं।
प्लानिंग चीनी डेवलपर्स के बीच सबसे कमजोर क्षेत्र बना हुआ है। किसी भी चीनी मॉडल ने इंटरैक्शन और प्लानिंग श्रेणी में 40 से अधिक अंक प्राप्त नहीं किए, और चार ओपन-सोर्स प्रविष्टियों ने 14.29 या उससे कम का परिणाम दिखाया। तुलना के लिए, GPT-6 Astra ने कुल मिलाकर 86.75 अंक प्राप्त किए, और Gemini-3.8-Flash ने 82.12 अंक प्राप्त किए, जबकि रोबोटिक्स पर केंद्रित Gemini-Robotics-ER-2-Preview ने 70.86 अंक प्राप्त किए।
MyDrivers ने उल्लेख किया कि जैसे-जैसे अधिक कंपनियां एम्बोडीड ब्रेन बना रही हैं, विभिन्न परीक्षण सेटों पर आधारित रैंकिंग अक्सर विरोधाभासी परिणाम देती हैं, और इन मॉडलों की क्षमताएं काफी हद तक उस व्यावहारिक कार्य की मात्रा को निर्धारित करेंगी जिसे भविष्य के रोबोट कर सकते हैं। सुपरक्ल्यू ने पहले जनवरी और फरवरी 2026 में इस रैंकिंग के संस्करण प्रकाशित किए थे।

