Xiaomi kompaniyasining LLM-Core tadqiqotchilari arXivʼda (2609.26368) HySparse2 arxitekturasini maqolada eʼlon qilishdi. Ushbu texnologiya ikki darajali kalit-qiymatlar (KV sharing) mexanizmi bilan gigrid tarqalgan diqqat (sparse attention) boʻlib, u uzun gorizontlarni qayta ishlashni talab qiladigan MiMo-V3 sinfidagi agent vazifalari uchun ishlab chiqilgan.
Ushbu ishlab chiqishning rasmiy brendlashida Xiaomi, MiMo va HySparse2 kiritilgan. Ushbu nashr ochiq ogʻirlikli MiMo-V2.6 ning avvalgi koʻrib chiqilishlaridan farqli oʻlaroq, tadqiqot arxitekturasi va eʼlon qilingan samaradorlik koʻrsatkichlariga eʼtibor qaratadi.
HySparse2 modelning asosiy qismini YOCO uslubidagi oʻz-dekoder va kross-dekoderga ajratadi. Tashqi darajada KV Bridging mexanizmi faqat toʻliq diqqatli qatlamlarni bogʻlaydi, shu bilan birga kross-dekoderning KV keshlari oʻz-dekoderning yashirin holatlaridan proyeksiyalangan. Ichki darajada takomillashtirilgan KV qayta foydalanish har bir gigrid blok ichida HySparse uslubidagi umumiy foydalanishni saqlab qoladi, ammo u bloklar darajasidan tokenlar darajasiga oʻtadi. Bundan tashqari, alohida silliq oynacha (sliding window) yoʻnalishi oʻrniga, tarqalgan tanlovlarga yaqinda joylashgan mahalliy oynacha majburan kiritiladi.
Bu oʻzgarishlar tufayli, oldindan qayta ishlash (Prefill) bosqichi kross-dekoder qatlamlarini kesh qurish paytida chetlab oʻtib, oʻz-dekoderdan soʻng yakunlanishi mumkin. Bu koʻp bosqichli agentlarda, kirish tokenlari sezilarli darajada vositalar kuzatuvlaridan iborat boʻlgan hollarda ayniqsa foydalidir.
80B-A3B hajmdagi, bir xil maʼlumotlar va grafiklar ustida oʻqitilgan MoE modellaridan foydalanilganda, maqola HySparse2 ning ozgina qoʻshimcha oʻqitishdan soʻng MRCR-v2 va RULER-v2 koʻrsatkichlarini mos ravishda 11,30 va 19,81 foiz punktiga oshirishini, shu bilan birga 256 ming token kontekstida AgentPPL va LongPPL ning pastroq qiymatlarini saqlab qolishini bildiradi. 1 million token bilan ishlayotganda, tahlil HySparse ga nisbatan 2,92× va Hybrid SWA ga nisbatan 5,02× oldindan qayta ishlashda FLOPs ning pasayishini koʻrsatadi. Shuningdek, FP8 KV kesh hajmi tegishli asosiy modellarga nisbatan 6,72 GB va 12,09 GB dan taxminan 2,69 GB gacha kamayishi qayd etiladi.
Ablatsiya tahlili shuni koʻrsatadiki, tokenlar darajasidagi tanlov belgilangan diqqat byudjeti bilan kuchliroq qidiruvga yordam beradi. 290B-A8B gacha kengaytirilganda, KV Bridging mexanizmi taqqoslanadigan sifatni saqlab qoladi, shu bilan birga oldindan qayta ishlashda erta chiqish imkoniyatini taʼminlaydi. Xitoy LLM tizimlari tadqiqotlarini oʻrganuvchi mutaxassislar uchun HySparse2 MiMo-V3 ning samaradorligi haqidagi bayonotlarning orqasidagi arxitektura signali boʻlib, ochiq ogʻirlikli yangi chiqarish emas.

