Unitree 64 vazifa namoyishidan soʻng UnifoLM-WLA-1.0 modelining qisman vaznlarini chiqardi
Batafsil
Pandaily
pandaily.com

Unitree 64 vazifa namoyishidan soʻng UnifoLM-WLA-1.0 modelining qisman vaznlarini chiqardi

Unitree Robotics kompaniyasi modelning va tegishli maʼlumotlar toʻplamlarining qisman vaznlarini eʼlon qilishni boshladi. Bu model humanoid robotlar uchun fundamental model boʻlib, taxminan 6 milliard parametrga ega va til hamda real dunyo harakatlari bilan ishlash uchun moʻljallangan. Avvalroq kompaniya model arxitekturasini va 64 ta vazifa boʻyicha baholash matritsasini taqdim etgan edi.

Xitoy texnologik nashrining sentabr oyining 20-kun sanligidagi hisobotiga koʻra, tizimning baʼzi komponentlari endi loyiha sahifasida yuklab olish uchun mavjud. Biroq, oʻqitilgan kod, UnifoLM-WLA-Base vaznlari, butun tana teleoperatsiya korpuslari va operatsiyalar uchun kengroq maʼlumotlar toʻplamlari hali kutilmoqda.

Bu bosqichma-bosqich ochiq chiqarilishi loyiha sahifasida avval berilgan eʼlonning yangilanishidir, u yerda Kod, Modellar va Maʼlumotlar toʻplamlari dastlab «tez orada paydo boʻladi» deb belgilangan edi. Shu bilan birga, ishlab chiqishning dasturiy jihati Unitree ning yaqinda chiqqan G1+ apparat taʼmiridan alohida qolmoqda.

Bir ta nazorat namunasi Unitree ning ochiq maʼlumotlar toʻplamlari va BitRobot HIW-500 kabi jamoat manbalaridan olingan taxminan 2500 soatlik maʼlumotlar asosida oʻqitilgan. U butun tana bilan bogʻliq 10 ta vazifa va stol ustidagi 54 ta vazifani qamrab olish uchun moʻljallangan, har bir rutin operatsiya uchun alohida siyosat ishga tushirish shart emas.

Unitree keltirgan kundalik vazifalarga havlilar yigʻish, idishlarni joylashtirish, batareyalarni zaryadlash, kiyim yuvish va divanlarni tozalash kabi vazifalar kiradi — bu qoʻllar, yakuniy effektorlar va oyoqlarning sinxronizatsiyasini talab qiladigan topshiriqlar. Birlikdagi harakatlar maydoni yakuniy effektorlar holatlari, qoʻl va pastki tana boʻgʻinlarining kvantlash orqali tokenizatsiyasidan foydalanadi, bu usul ushbu oqimlarning vaqt boʻyicha uygʻunligini saqlab turish imkonini beradi.

Taʼkidlangan testlarda parallel ikki barmoqli ushlashlar va koʻp sonli besh barmoqli qoʻllar qoʻllab-quvvatlanadi. Harakatlar eksperti MMDiT modeli boʻlib, bu mujassamlangan fikrlash modeli hisoblanadi. U Qwen3-VL-4B asosida qurilgan va aniqlash, aniqlash, koʻp tasvirli fikrlash va yoʻnalish bashoratini qamrab oluvchi 5 milliondan ortiq fazoviy namunalarni oʻz ichiga oladi.

Unitree kompaniyasi oʻz kompaniyasi tomonidan tuzilgan oʻn oltita multimodal idrok etish benchmarklarining yettisida ochiq modellar orasida yetakchi ekanligini maʼlum qiladi, jumladan Where2Place, EmbSpatial va RoboSpatial. Baʼzi koʻrsatkichlar shu jadvallardagi maxsus tizimlarning koʻrsatkichlari bilan taqqoslanadi. Eʼtiborga loyiqki, bu raqamlar faqat kompaniya tomonidan taqdim etilgan va yana uchinchi tomon tomonidan tasdiqlanmagan, va ular yolgʻiz oʻzlari bilan haqiqiy uylarda muvaffaqiyatni isbotlamaydi.

Integratorlar uchun amaliy xulosa bosqichma-bosqich ochilishdir: hozirda mos keladigan qisman vaznlar mavjud, ammo toʻliq kod va maʼlumotlar korpuslari hali kutilmoqda. Qolgan resurslar paydo boʻlguncha, Unitree ga tegishli boʻlmagan robotlarga funksiyalarni oʻtkazish haqidagi barcha bayonotlar yoʻl xaritasi sifatida qaralishi kerak, uchinchi tomonning tayyor toʻplami sifatida emas.

Oʻxshash hikoyalar

StepFun Step 5 ning dastlabki versiyasini chiqardi: 600 milliard parametrli, razretilgan MoE va 1 million token kontekstiga ega model
Batafsil
pandaily.com

StepFun Step 5 ning dastlabki versiyasini chiqardi: 600 milliard parametrli, razretilgan MoE va 1 million token kontekstiga ega model

StepFun kompaniyasi razretlangan Mixture-of-Experts (MoE) arxitekturasi asosidagi va taxminan 600 milliard umumiy parametrga ega boʻlgan Step 5 modelining dastlabki versiyasini taqdim etdi, bunda har bir token uchun taxminan 27 milliard faollashtiriladi. Ushbu chiqarish agentlar uchun uzoq muddatli yuklar, shu jumladan AI yordamida kod ishlab chiqish, dasturiy muhandislik, moliyaviy tahlil va professional bilimlar bilan ishlashga qaratilgan. Model bir million token kontekst oynasini qoʻllab-quvvatlaydi va matn ham, grafik kiritmalarni qabul qiladi. StepFun API orqali kirishning allaqachon ochilganini maʼlum qildi va model vaznlari 15-oktabrda jamoatchilikka ochiq qilish rejalashtirilgan.

Tarmoqni kengaytirish oʻrniga, Step 5 Preview 92 qatlamdan iborat tor, chuqur Transformer arxitekturasidan foydalanadi. Kompaniya chuqurroq steklar maʼlumot uzatish uchun uzoqroq yoʻllarni taʼminlashini va agentlar vositalardan foydalanishda qidirish, kod ishga tushirish va natijalarni qayta ishlash paytida noaniq koʻp bosqichli fikrlashni taʼminlashini taʼkidlaydi. Bir million tokenli sessiyalarning amaliyotga mos kelishini taʼminlash uchun model bloklar boʻyicha tokenlarni birlashtiradigan Sparse Grouped-Query Attention (Razretilgan Guruhli-Soʻrov Diqqati) ni oʻz ichiga oladi. StepFunning aytishicha, bu ixloskor indekslovchi va top-k tanlash xarajatlarini yanada zich asosiy modelga nisbatan sakkizdan biriga kamaytiradi, shu bilan birga qoplamali qoʻshni tanlovlarni birlashtiradi.

Oʻqitish jarayonida siyosat boʻyicha uzoq muddatli kuchaytirish bilan oʻrganish (on-policy long-horizon reinforcement learning) va MoE marshrutlashida bit darajasida oʻrganish va inferensni uygʻunlashtirishga urgʻu beriladi. Bundan tashqari, yukni hisobga olgan jadval tuzish (load-aware scheduling), MTP-3 spekulyativ dekodlash, FP8 MoE va KV-keshni yuklash kabi usullar qoʻllaniladi. StepFun uzoq muddatli RL ning butun jarayonini uch marta tezlashtirish va namunalar roʻyxatidagi yoʻqotish koʻrsatkichi bir foizdan past ekanligini hisobot beradi. Ushbu model shuningdek, ilmiy tadqiqotlar, dasturiy taʼminot ishlab chiqish va mashinaviy taʼlim sohasidagi tadqiqotlarni qamrab oluvchi millionlab tekshiriladigan murakkab vazifalarni yaratadigan inson tomonidan boshqariladigan maʼlumotlar quvveti ichida ishlatiladi.

Sunʼiy intellektni tahlil qilish boʻyicha, Step 5 Preview ushbu reyting tizimida ochiq vaznli eng yaxshi modellar qatoriga kiradigan intellekt indeksi boʻyicha taxminan 44 ball oladi. Eʼlon qilingan narxlarga koʻra, API xarajatlari bir million kirish tokeni uchun taxminan 1 dollar va bir million chiqish tokeni uchun 2,7 dollar ni tashkil etadi, chiqish tezligi esa sekundiga taxminan 100 tokenni tashkil etadi. Modelning asosiy eʼtibori arxitektura va agent samaradorligiga qaratilgan, bu uni avvalgi Step 3.5 Flash va Step 3.7 Flash nashrlaridan ajratib turadi, chuqurlik, razretilgan uzoq kontekst va vazifalarni ishonchli koʻp bosqichli foydalanishga urgʻu beradi, bu vaznlar oktyabr oyida mavjud boʻlishidan oldin.

Shanghai AI Lab robototexnika uchun kuch va taktil qayta aloqali Intern W0 jismoniy dunyo modelini taqdim etdi
Batafsil
pandaily.com

Shanghai AI Lab robototexnika uchun kuch va taktil qayta aloqali Intern W0 jismoniy dunyo modelini taqdim etdi

Shanghai Sunʼiy Intellekt Laboratoriyasi Intern W0 jismoniy dunyo modelini ishlab chiqdi. Ushbu stek tizimi robototexnikaga qaratilgan boʻlib, katta modellar xatti-harakatlarini raqamli rejalashtirishdan kontaktlar bilan boy jismoniy ishga oʻtkazish uchun moʻljallangan.

Laboratoriya W0 dastlab koʻrish, kuch va sezuvchanlik maʼlumotlarini birlashtirish maqsadida ishlab chiqilganligini taʼkidlaydi. Bu robotga qattiq siklga amal qilish oʻrniga — avval idrok etish, keyin rejalashtirish, keyin harakatlanish — oʻrniga, bir vaqtning oʻzida qabul qilish, bashorat qilish, harakat qilish va oʻz harakatlarini tuzatish imkonini beradi.

Ushbu model laboratoriyaning Shanghai Jiao Tong universiteti bilan LUMIA Lab hamkorligidan farq qiladi, bu hamkorlik darajasi yuqori tushunchalarni bashorat qilishga eʼtibor qaratadi, kuchga asoslangan jismoniy boshqaruvga emas.

W0 ning chiqarilishi ikkita asosiy element bilan belgilanadi. Birinchisi — bu kuch va sezuvchanlikning tabiiy sensorli idroki boʻlib, u kontaktdan kelib chiqqan qayta aloqni vizual maʼlumotlar va tananing proprioseptiv holati bilan birga harakat tanlash va idrok etish jarayoniga integratsiya qiladi. Koʻrish yaqinlashish yoʻnalishlarini va maqsadli nuqtalarni aniqlaydi, kuch va sezuvchanlik esa ushlash sifatini yangilaydi va kontakt boshlangandan soʻng sirpanishni qayd etadi. Proprioseptiv holat joylashuv va harakatni kuzatib boradi.

Ikkinchi prinsip — bu ikki tomonlama oʻzaro taʼsir boʻlib, u til koʻrsatmalari, vizual kuzatuvlar, kuch/sezuvchanlik qayta aloqsi va tananing holati kabi multimodal kirish maʼlumotlarining uzluksiz oqimini qoʻllab-quvvatlaydi. Shu bilan birga, model semantik tushunish, kelajak holatlarining prognozlari va harakat buyruqlarini hosil qiladi. Koʻp tezlikli rejimdagi asinxron arxitektura fon rejalashtirishining uzoq muddatli yangilanishiga imkon beradi, shu bilan birga yuqori chastotali harakat yangilanishlari yangi kuzatuvlarga javob berishda davom etadi, shunda atrof-muhit oʻzgarishi va harakatni toʻgʻrilash orasidagi interval qisqaradi, ayniqsa koʻrish yolgʻiz qolganida.

Tadqiqotchilar bunday kombinatsiya yuqori aniqlik talab qiladigan vazifalarni bajarishga yordam berishini taʼkidlaydilar, masalan, ushlash barqarorligini aniqlash, kontaktning toʻgʻri joylashuvi yoki keyingi mikrotoʻgʻrilash qanday koʻrinishi kerakligini aniqlash. W0 modeli allaqachon laboratoriya portalida taqdim etilgan inglizcha mahsulot nomi Intern InkStone ilmiy kashfiyotlar platformasi bilan integratsiya qilingan. U Intern S2 katta ilmiy model bilan birgalikda ishlaydi.

Ular birgalikda namuna laboratoriya sharoitlari hamda quruq laboratoriya sharoitlarida yopiq tsiklarni qoʻllab-quvvatlashni taʼminladilar. Ushbu tsikllar genlarni tahrirlash uchun oqsilning yoʻnaltirilgan evolyutsiyasini, mepivakin organik sintezini va lipid nanochiziqlarini tayyorlashni oʻz ichiga olgan boʻlib, nanochiziqlar bilan ishlash paytida jarayon parametrlarini dinamik sozlashni oʻz ichiga oladi, bu ikkilamchi manbalarda fan uchun yoʻnaltirilgan jismoniy AI ning dastlabki dalili sifatida tilga olinadi.

Kimyo, biologiya va materialshunoslik bilan shugʻullanuvchi guruhlar uchun W0 isteʼmolchi robotining namoyishi emas, balki avtomatlashtirilgan eksperimental tsikllar uchun vosita sifatida qaraladi. Stek Intern toʻplami Intern InkStone ish jarayonlarida standart qatlam boʻlib qolishi yoki oldin namoyish etilgan yopiq tsikl holatlariga bogʻliq qolishi, kuch va sezuvchanlikning ikki tomonlama nazoratining turli laboratoriya asboblarida va namuna laboratoriyalari protokollarida qanchalik keng umumlashtirilishi aniqlanadi. Laboratoriya bu holatlarni sxemalardan vositalar eksperimentiga oʻtish yoʻlining boshlanishi sifatida taqdim etadi, tayyor mahsulot katalogi sifatida emas.

Unitree UnifoLM-WLA-1.0 modelini taqdim etdi — humanoid robotlar uchun fundamental model
Batafsil
pandaily.com

Unitree UnifoLM-WLA-1.0 modelini taqdim etdi — humanoid robotlar uchun fundamental model

Unitree kompaniyasi 10-sentabrda yangi avlod humanoid robotlar uchun generativ fundamental model boʻlgan va taxminan 6 milliard parametrga ega boʻlgan UnifoLM-WLA-1.0 ni taqdim etdi. Kompaniyaning bayonotiga koʻra, haqiqiy robot maʼlumotlari asosida 2500 soat davomida oʻqitilgan bitta nazorat fayli 10 tananing harakatlari va 54 stoldagi manipulyatsiyalarni qamrab oluvchi 64 vazifani muvofiqlashtira oladi, shuningdek, ikki barmoqli ushlagichlar va bir nechta mahoratli besh barmoqli qoʻllar bilan ishlashi mumkin.

Bu chiqarish Unitree UnifoLM-X2 sparringning oldingi namoyishidan farq qiladi; UnifoLM-WLA-1.0 jangovar faoliyatga yoʻnaltirilgan namoyish emas, balki kundalik uy va stoldagi ishlar bajarilishi uchun kengroq «koʻrish-til-harakat» stekini ifodalaydi.

Arxitektura jihatdan UnifoLM-WLA-1.0 MMDiT harakat eksperti bilan boyitilgan, oʻzaro taʼsirga yoʻnaltirilgan dunyo modellashtirishiga asoslanadi. UnifoLM-ER-1 deb nomlangan bu jismoniy fikrlash bosqichi Qwen3-VL-4B asosida qurilgan va 5 milliondan ortiq jismoniy namunalar ustida oʻqitilgan. Bu namunalar nuqtalar prognozlash, obʼektlarni aniqlash, koʻp tasvirli fikrlash, 2D traektoriyalar, 3D aniqlash va fazoviy savollarga javob berish kabi jihatlarni qamrab oladi, bu fazoviy idrokni kuchaytiradi, shu bilan birga keng koʻrinish-til koʻnikmalarini saqlab qolish uchun umumiy tasvir va matn maʼlumotlari bilan birgalikda oʻrganiladi.

Bundan tashqari, dinamik hududlarni prognozlash kelajakdagi sahna oʻzgarishlarini ajratib olish uchun optik oqimdan foydalanadi, ularni fiksatsiya qilingan uzunlikdagi maska tokenlariga VQ-VAE yordamida siqib, «koʻrish-til» modeliga oʻzaro aloqa boshlangandan soʻng qaysi hududlar harakatlanishni boshlayotganini bashorat qilishni oʻrgatadi. Qoldiq vektor kvantlash orqali diskret harakatlarni oʻrganish yakuniy effektor pozalari, qoʻl va tana pastki qismining boʻgʻinlarini birlashtirilgan harakatlar fazosini ajratadi, bu tokenlarni umumiy vaqtinchalik qadamlar boʻyicha tekislaydi va ularni UnifoLM-ER-Flow ga kiritadi. Ular chiqargan WLA modeli ushbu multimodal ramkadan robotning uzluksiz harakatlarini dekod qilish uchun MMDiT ekspertini oʻz ichiga oladi.

16 ta multimodal toʻplamlar ustida oʻtkazilgan fazoviy va jismoniy fikrlash testlarida Unitree UnifoLM-ER-1-4B ochiq modellardan yetti sinovda ustun turishini maʼlum qiladi. Bundan tashqari, kesishgan fazoviy toʻplamlarda u Where2Place, BLINK spatial, CV-Bench va EmbSpatial kabi koʻrsatkichlarda mahalliy maxfiy GPT-6 Astra dan ustun keladi. Oʻquv Unitree Open Datasets va BitRobot-HIW-500 hamda haqiqiy robotlar maʼlumotlarining boshqa manbalariga tayanadi. Video baholashlar Unitree G1 uskunalariida khiniklar yigʻish, telefonlarni qadoqlash, yotoqni tartiblash, poyabzalni saralash va hammomni tozalash kabi vazifalarni bajarish namoyish etiladi — bu vazifalar bitta siyosat doirasida qoʻllar, yakuniy effektorlar va tana pastki qismining muvofiqlashtirilgan harakatini talab qiladi.

Muhim jihati shundaki, loyiha sahifasi ishlab chiquvchilar uchun mavjud, ammo kod, modellar va maʼlumotlar toʻplamlari hali «Yaqin orada» belgilangan. Unitree loyihani ochiq kodli qilish niyatini eʼlon qildi va arxitektura hamda vazifa matritsasi boʻyicha hujjatlashtirishni nashr etdi, ammo ogʻirliklar va maʼlumotlar korpusi hali yuklab olish uchun mavjud emas. Ushbu resurslar paydo boʻlishidan oldin tadqiqotchilar va integratorlar uchun amaliy signal umumiy humanoid asosning oshkor qilingan yoʻl xaritasi va benchmarklar jadvali hisoblanadi, naqadar tayyor nazorat fayli emas.

Mashhur