Xiaomi tadqiqotchilari tokenlarni oldindan qayta ishlashdagi hisoblash xarajatlarini kamaytiruvchi MiMo-V3 uchun HySparse2ni taqdim etdi
Batafsil
Pandaily
pandaily.com

Xiaomi tadqiqotchilari tokenlarni oldindan qayta ishlashdagi hisoblash xarajatlarini kamaytiruvchi MiMo-V3 uchun HySparse2ni taqdim etdi

Xiaomi kompaniyasining LLM-Core tadqiqotchilari arXivʼda (2609.26368) HySparse2 arxitekturasini maqolada eʼlon qilishdi. Ushbu texnologiya ikki darajali kalit-qiymatlar (KV sharing) mexanizmi bilan gigrid tarqalgan diqqat (sparse attention) boʻlib, u uzun gorizontlarni qayta ishlashni talab qiladigan MiMo-V3 sinfidagi agent vazifalari uchun ishlab chiqilgan.

Ushbu ishlab chiqishning rasmiy brendlashida Xiaomi, MiMo va HySparse2 kiritilgan. Ushbu nashr ochiq ogʻirlikli MiMo-V2.6 ning avvalgi koʻrib chiqilishlaridan farqli oʻlaroq, tadqiqot arxitekturasi va eʼlon qilingan samaradorlik koʻrsatkichlariga eʼtibor qaratadi.

HySparse2 modelning asosiy qismini YOCO uslubidagi oʻz-dekoder va kross-dekoderga ajratadi. Tashqi darajada KV Bridging mexanizmi faqat toʻliq diqqatli qatlamlarni bogʻlaydi, shu bilan birga kross-dekoderning KV keshlari oʻz-dekoderning yashirin holatlaridan proyeksiyalangan. Ichki darajada takomillashtirilgan KV qayta foydalanish har bir gigrid blok ichida HySparse uslubidagi umumiy foydalanishni saqlab qoladi, ammo u bloklar darajasidan tokenlar darajasiga oʻtadi. Bundan tashqari, alohida silliq oynacha (sliding window) yoʻnalishi oʻrniga, tarqalgan tanlovlarga yaqinda joylashgan mahalliy oynacha majburan kiritiladi.

Bu oʻzgarishlar tufayli, oldindan qayta ishlash (Prefill) bosqichi kross-dekoder qatlamlarini kesh qurish paytida chetlab oʻtib, oʻz-dekoderdan soʻng yakunlanishi mumkin. Bu koʻp bosqichli agentlarda, kirish tokenlari sezilarli darajada vositalar kuzatuvlaridan iborat boʻlgan hollarda ayniqsa foydalidir.

80B-A3B hajmdagi, bir xil maʼlumotlar va grafiklar ustida oʻqitilgan MoE modellaridan foydalanilganda, maqola HySparse2 ning ozgina qoʻshimcha oʻqitishdan soʻng MRCR-v2 va RULER-v2 koʻrsatkichlarini mos ravishda 11,30 va 19,81 foiz punktiga oshirishini, shu bilan birga 256 ming token kontekstida AgentPPL va LongPPL ning pastroq qiymatlarini saqlab qolishini bildiradi. 1 million token bilan ishlayotganda, tahlil HySparse ga nisbatan 2,92× va Hybrid SWA ga nisbatan 5,02× oldindan qayta ishlashda FLOPs ning pasayishini koʻrsatadi. Shuningdek, FP8 KV kesh hajmi tegishli asosiy modellarga nisbatan 6,72 GB va 12,09 GB dan taxminan 2,69 GB gacha kamayishi qayd etiladi.

Ablatsiya tahlili shuni koʻrsatadiki, tokenlar darajasidagi tanlov belgilangan diqqat byudjeti bilan kuchliroq qidiruvga yordam beradi. 290B-A8B gacha kengaytirilganda, KV Bridging mexanizmi taqqoslanadigan sifatni saqlab qoladi, shu bilan birga oldindan qayta ishlashda erta chiqish imkoniyatini taʼminlaydi. Xitoy LLM tizimlari tadqiqotlarini oʻrganuvchi mutaxassislar uchun HySparse2 MiMo-V3 ning samaradorligi haqidagi bayonotlarning orqasidagi arxitektura signali boʻlib, ochiq ogʻirlikli yangi chiqarish emas.

Oʻxshash hikoyalar

Xiaomi RL stack yordamida MiMo-V2.6 Pro va MiMo-V2.6 Flash modellar uchun vaznlar va resurslarni ochdi
Batafsil
pandaily.com

Xiaomi RL stack yordamida MiMo-V2.6 Pro va MiMo-V2.6 Flash modellar uchun vaznlar va resurslarni ochdi

Xiaomi kompaniyasi oʻzining MiMo-V2.6 seriyasi uchun kuchaytirish orqali oʻrganish (reinforcement-learning) uchun vaznlar, texnik hujjatlar va resurslarni ommaga oshirdi. Xiaomi tomonidan sentyabrning 22-kun sanaydigan inglizcha xabarlarga koʻra, MiMo-V2.6-Pro va MiMo-V2.6-Flash repozitoriyalari Hugging Face platformasida RL kodi va 7000 dan ortiq sinov muhitlari bilan birga eʼlon qilindi.

Bu chiqarish vaznlar va kodni taqdim etishi bilan ajralib turadi, bu oldingi RL oʻrganish jarayonini toʻgʻridan-toʻgʻri efir orqali yoritishdan farq qiladi. Brendlash oʻzgarmaydi: Xiaomi / MiMo.

Pro va Flash modellarining nativ multimodal modellar sifatida joylashtirilishi va bir million token atrofidagi eʼlon qilingan kontekst oynasiga ega ekanligi taʼkidlanadi. Modellar kartochkalari va qoʻshimcha hisobotlar ingliz tilida Pro modeli kamida 1,02 trillion parametrli sekin aralash ekspertlar (sparse mixture-of-experts) arxitekturasiga ega ekanligini va unda taxminan 42 milliard parametr faol ishlatilayotganini koʻrsatadi. Flash modeli esa 309 milliard umumiy parametr va taxminan 15 milliard faollik bilan baholanadi.

Xiaomi maʼlumot berishicha, har bir model olti kundan kamroq vaqt ichida taxminan 750 000 yoʻnalishlar doirasida 30 ta RL qadamidan oʻtgan. Jarayon davomida kodlash, umumiy agent ishlashi, vizual vazifalar va kiberxavfsizlikni oʻz ichiga olgan vazifalarning aralashmasi ishlatilgan. Shu bilan birga, har bir yangilanishda taxminan 1568 soʻrov va 16 ishga tushirish ishlatilgan, va har bir qadamdagi maʼlumot hajmi 3,5–3,7 milliard tokenni tashkil etgan.

Kompaniya maʼlumotlariga koʻra, oʻrganish vazifalari boʻyicha samaradorlik taxminan 25% ga Flash va 12% ga Pro uchun oshgan. Bundan tashqari, DeepSWE v1.1 da yaxshilanishlar qayd etildi: Flash uchun 48,8 dan taxminan 65,7 gacha va Pro uchun 58,4 dan taxminan 72,6 gacha, ammo bu koʻrsatkichlar yetkazib beruvchi tomonidan taqdim etilgan maʼlumotlar boʻlib, uchinchi tomonlar tomonidan tasdiqlanishi talab etiladi.

Mavjud aktivlar shunchaki nazorat nuqtalaridan iborat emas. Xiaomi dasturiy taʼminot ishlab chiqish, zaifliklarni nusxalash, intellektual mehnat va veb-dizaynni qamrab oluvchi 7000 dan ortiq klassifikatsiya qilingan muhitlar asosida qurilgan keng qamrovli RL freymvorkini taqdim etdi. Shuningdek, RL sohasidagi jamoatchilik tajribalari uchun Distill-Qwen-9B boshlangʻich nuqtasi va koʻp kanalli oʻrganish uchun yengil komponentlar mavjud. Joylashtirilgan Pro va Flash versiyalari uchun API narxi MiMo-V2.5 ga mos kelishi eʼlon qilingan, shu bilan UltraSpeed darajasi sifatni saqlagan holda standart Pro dan 20 marta yuqori uzatish quvvatini vaʼda qiladi.

Biroq, muhandislar hali ham katta MoE ni texnik jihatdan taʼminlashning yuqori xarajatlari bilan duch kelishmoqda, va Xiaomining sunʼiy tahlil va agentlarning benchmarklari haqidagi bayonotlari tashqi nusxa koʻrishni talab qiladi. Asosiy yangilik – bu laboratoriyalar shunchaki toʻgʻridan-toʻgʻri efirda grafik koʻrinish emas, balki oʻz vakillari bilan oʻrganishi mumkin boʻlgan ochiq vaznlar, RL kodi va muhitlar bilan toʻliq MiMo-V2.6 paketidir.

Mashhur