NaiveAI Naive-N0.5-Flash modelini chiqardi: 309B MoE, 1M kontekst bilan MIT litsenziyasi ostida
Batafsil
Pandaily
pandaily.com

NaiveAI Naive-N0.5-Flash modelini chiqardi: 309B MoE, 1M kontekst bilan MIT litsenziyasi ostida

NaiveAI kompaniyasi Hugging Face platformasida ochiq ogʻirliklarga ega Naive-N0.5-Flash modelini taqdim etdi. Ushbu model Mixture-of-Experts (MoE) arxitekturasini tashkil etadi va dasturiy kodni ishlab chiqish hamda sunʼiy intellekt sohasidagi tadqiqotlar uchun moʻljallangan. Model haqidagi maʼlumot sentyabr 2026 yilning oʻrtasi yoki oxirida eʼlon qilindi.

Mahsulotning rasmiy nomi — NaiveAI / Naive-N0.5-Flash. Texnik hujjatlarga koʻra, umumiy parametrlar soni taxminan 309 milliardga yetadi, shu bilan birga faol boʻlgan ogʻirliklar 15,5 milliardni tashkil etadi. Model MIT litsenziyasi ostida tarqatiladi va inferens kodi, shuningdek, bir million tokenli kontekst oynasiga tabiiy qoʻllab-quvvatlashni oʻz ichiga oladi.

Kontekst uzunligi Sliding-Window Attention (SWA) mexanizmi va guruhli diqqatdan foydalanadigan yengil DeepSeek Sparse Attention (DSA) ning gibrid birlashmasi orqali erishiladi. Arxitektura asosan SWA–DSA nisbati 5:1 ga teng deb tasvirlanadi, bunda stackda toʻliq diqqat (fully attention) qatlamlari mavjud emas. Model MiMo-V2.5 ochiq modeliga asoslanadi, undan keyin toʻldirish va post-treningdan oʻtadi, noldan toʻliq oldindan oʻqitilmaydi.

Xizmat koʻrsatish nuqtai nazaridan, NaiveAI NaiveRT — AIga yoʻnaltirilgan tadqiqotlar asosida ishlab chiqilgan inferens stackiga urgʻu beradi. Ushbu stack mega-yadro birlashmasi (mega-kernel fusion), Dasturiy Bogʻliq Ishga Tushirish (Programmatic Dependent Launch) va spekulyativ dekodlashni birlashtiradi. Yetkazib beruvchining maʼlumotlariga koʻra, standart rejimda foydalanuvchi uchun qayta ishlash tezligi taxminan 50 token/sekund, Ultratez rejimda esa sekundiga 2000 tokengacha yetadi.

Hugging Faceʼdagi teglar modelning kod uchun matn yaratish, uzoq kontekst bilan ishlash va AI tadqiqotlari vazifalari uchun mos kelishini taʼkidlaydi. Bu, kuchli ochiq bazada toʻldirish va post-trening orqali kodlash agentlarini ilgari surish mumkinligi haqidagi bayonotga mos keladi. Bu hafta xitoy MoE nashrlarini solishtirayotgan ishlab chiquvchilar uchun Naive-N0.5-Flash MIT litsenziyasi ostidagi 309B / 15.5B MoE va million tokenli gibrid kontekstning aniq misolidir, bu mahsulot narxi yoki ishga tushishi haqida emas, balki arxitektura haqidagi yangilikdir.

Oʻxshash hikoyalar

Xiaomi tadqiqotchilari tokenlarni oldindan qayta ishlashdagi hisoblash xarajatlarini kamaytiruvchi MiMo-V3 uchun HySparse2ni taqdim etdi
Batafsil
pandaily.com

Xiaomi tadqiqotchilari tokenlarni oldindan qayta ishlashdagi hisoblash xarajatlarini kamaytiruvchi MiMo-V3 uchun HySparse2ni taqdim etdi

Xiaomi kompaniyasining LLM-Core tadqiqotchilari arXivʼda (2609.26368) HySparse2 arxitekturasini maqolada eʼlon qilishdi. Ushbu texnologiya ikki darajali kalit-qiymatlar (KV sharing) mexanizmi bilan gigrid tarqalgan diqqat (sparse attention) boʻlib, u uzun gorizontlarni qayta ishlashni talab qiladigan MiMo-V3 sinfidagi agent vazifalari uchun ishlab chiqilgan.

Ushbu ishlab chiqishning rasmiy brendlashida Xiaomi, MiMo va HySparse2 kiritilgan. Ushbu nashr ochiq ogʻirlikli MiMo-V2.6 ning avvalgi koʻrib chiqilishlaridan farqli oʻlaroq, tadqiqot arxitekturasi va eʼlon qilingan samaradorlik koʻrsatkichlariga eʼtibor qaratadi.

HySparse2 modelning asosiy qismini YOCO uslubidagi oʻz-dekoder va kross-dekoderga ajratadi. Tashqi darajada KV Bridging mexanizmi faqat toʻliq diqqatli qatlamlarni bogʻlaydi, shu bilan birga kross-dekoderning KV keshlari oʻz-dekoderning yashirin holatlaridan proyeksiyalangan. Ichki darajada takomillashtirilgan KV qayta foydalanish har bir gigrid blok ichida HySparse uslubidagi umumiy foydalanishni saqlab qoladi, ammo u bloklar darajasidan tokenlar darajasiga oʻtadi. Bundan tashqari, alohida silliq oynacha (sliding window) yoʻnalishi oʻrniga, tarqalgan tanlovlarga yaqinda joylashgan mahalliy oynacha majburan kiritiladi.

Bu oʻzgarishlar tufayli, oldindan qayta ishlash (Prefill) bosqichi kross-dekoder qatlamlarini kesh qurish paytida chetlab oʻtib, oʻz-dekoderdan soʻng yakunlanishi mumkin. Bu koʻp bosqichli agentlarda, kirish tokenlari sezilarli darajada vositalar kuzatuvlaridan iborat boʻlgan hollarda ayniqsa foydalidir.

80B-A3B hajmdagi, bir xil maʼlumotlar va grafiklar ustida oʻqitilgan MoE modellaridan foydalanilganda, maqola HySparse2 ning ozgina qoʻshimcha oʻqitishdan soʻng MRCR-v2 va RULER-v2 koʻrsatkichlarini mos ravishda 11,30 va 19,81 foiz punktiga oshirishini, shu bilan birga 256 ming token kontekstida AgentPPL va LongPPL ning pastroq qiymatlarini saqlab qolishini bildiradi. 1 million token bilan ishlayotganda, tahlil HySparse ga nisbatan 2,92× va Hybrid SWA ga nisbatan 5,02× oldindan qayta ishlashda FLOPs ning pasayishini koʻrsatadi. Shuningdek, FP8 KV kesh hajmi tegishli asosiy modellarga nisbatan 6,72 GB va 12,09 GB dan taxminan 2,69 GB gacha kamayishi qayd etiladi.

Ablatsiya tahlili shuni koʻrsatadiki, tokenlar darajasidagi tanlov belgilangan diqqat byudjeti bilan kuchliroq qidiruvga yordam beradi. 290B-A8B gacha kengaytirilganda, KV Bridging mexanizmi taqqoslanadigan sifatni saqlab qoladi, shu bilan birga oldindan qayta ishlashda erta chiqish imkoniyatini taʼminlaydi. Xitoy LLM tizimlari tadqiqotlarini oʻrganuvchi mutaxassislar uchun HySparse2 MiMo-V3 ning samaradorligi haqidagi bayonotlarning orqasidagi arxitektura signali boʻlib, ochiq ogʻirlikli yangi chiqarish emas.

Inspur Kimi K3 modeli bilan ishlash uchun 128 mahalliy chipga ega MetaBrain SD200 Ultra supertugunini taqdim etdi
Batafsil
pandaily.com

Inspur Kimi K3 modeli bilan ishlash uchun 128 mahalliy chipga ega MetaBrain SD200 Ultra supertugunini taqdim etdi

Inspur Information kompaniyasi MetaBrain SD200 Ultra sunʼiy intellekt supertugunini AICC2026 sunʼiy intellekt hisoblash konferensiyasida taqdim etdi. Ushbu tugun trilyonli parametrlar va agentlar bilan bogʻliq vazifalarni qayta ishlash uchun imkoniyatlar sinfi tizimi sifatida joylashtirilgan. Tizimning rasmiy inglizcha nomi — Inspur / MetaBrain.

Kompaniya va axborot agentliklari maʼlumotlariga koʻra, tugun 128 ta mahalliy AI chipini birlashtiradi, 8 TB unifikatsiyalangan tezlatuvchi xotirasiga va 64 TB host xotirasiga kirish imkonini beradi. U Moonshot AI tomonidan ishlab chiqilgan va 2,8 trillion parametrga ega boʻlgan Kimi K3 modelini bitta mashinada, token generatsiya kechikishi 5,85 millisekunddan kam boʻlgan holda ishga tushirishga qodir, bu Inspur baholariga koʻra, bir foydalanuvchi uchun sekundiga taxminan 170 tokenni tashkil etadi.

Tugunning arxitektura xususiyatlariga 0,69 mikrosekund kechikish bilan eʼlon qilingan, semantika ga sezgir xotira bilan tabiiy aloqani taʼminlovchi 3D Hyper Mesh fabrikasi kiradi. Shuningdek, qisqa harakatlanuvchi mis interkonnektlar va tezlatuvchilar uzoq tugunlarning xotirasiga bevosita murojaat qilish imkonini beradigan simmetrik xotira ishlatiladi. Inspur operatsiya AllReduce bajarilish vaqtining avvalgi yechimlarga nisbatan taxminan 3,5 marta qisqartirilganini daʼvo qiladi.

Bundan tashqari, Kimi K3 modelining KDA, gated MLA va MoE bosqichlari uchun oʻrnatilgan «superoperatorlar» operatorlar sonini taxminan oʻn marta kamaytiradi, shu bilan birga inferens samaradorligini uch barabardan ortiq oshiradi. Bu koʻrsatkichlar yetkazib beruvchining bayonotlaridir. Materiallar shuningdek, bitta tugunda 10 trillion gacha boʻlgan modellarni qoʻllab-quvvatlash potentsialini koʻrsatadi.

Boshqa mahsulot, MetaBrain HC2000, kelishilgan SLA cheklovlariga rioya qilinganda, sarmoyaga tokenlar oqimining oʻn barobar oshirilganligi eʼlon qilingan, sigʻim sinfidagi inferens uchun moʻljallangan bir nechta tezlatuvchilarga ega stansiyadir. Turli nashrlar tezlatuvchilarni faqat mahalliy yoki mahalliy AI chiplari deb tasvirlasa ham, ushbu sharh uchun tahlil qilingan asosiy manbalardan hech biri SD200 Ultra ichidagi kremniy ishlab chiqaruvchisini yoki SKU ni nomlamaydi. Shu sababli, ushbu maqola tugunni Ascend, Cambricon yoki boshqa aniq yetkazib beruvchiga bogʻlamaydi.

StepFun Step 5 ning dastlabki versiyasini chiqardi: 600 milliard parametrli, razretilgan MoE va 1 million token kontekstiga ega model
Batafsil
pandaily.com

StepFun Step 5 ning dastlabki versiyasini chiqardi: 600 milliard parametrli, razretilgan MoE va 1 million token kontekstiga ega model

StepFun kompaniyasi razretlangan Mixture-of-Experts (MoE) arxitekturasi asosidagi va taxminan 600 milliard umumiy parametrga ega boʻlgan Step 5 modelining dastlabki versiyasini taqdim etdi, bunda har bir token uchun taxminan 27 milliard faollashtiriladi. Ushbu chiqarish agentlar uchun uzoq muddatli yuklar, shu jumladan AI yordamida kod ishlab chiqish, dasturiy muhandislik, moliyaviy tahlil va professional bilimlar bilan ishlashga qaratilgan. Model bir million token kontekst oynasini qoʻllab-quvvatlaydi va matn ham, grafik kiritmalarni qabul qiladi. StepFun API orqali kirishning allaqachon ochilganini maʼlum qildi va model vaznlari 15-oktabrda jamoatchilikka ochiq qilish rejalashtirilgan.

Tarmoqni kengaytirish oʻrniga, Step 5 Preview 92 qatlamdan iborat tor, chuqur Transformer arxitekturasidan foydalanadi. Kompaniya chuqurroq steklar maʼlumot uzatish uchun uzoqroq yoʻllarni taʼminlashini va agentlar vositalardan foydalanishda qidirish, kod ishga tushirish va natijalarni qayta ishlash paytida noaniq koʻp bosqichli fikrlashni taʼminlashini taʼkidlaydi. Bir million tokenli sessiyalarning amaliyotga mos kelishini taʼminlash uchun model bloklar boʻyicha tokenlarni birlashtiradigan Sparse Grouped-Query Attention (Razretilgan Guruhli-Soʻrov Diqqati) ni oʻz ichiga oladi. StepFunning aytishicha, bu ixloskor indekslovchi va top-k tanlash xarajatlarini yanada zich asosiy modelga nisbatan sakkizdan biriga kamaytiradi, shu bilan birga qoplamali qoʻshni tanlovlarni birlashtiradi.

Oʻqitish jarayonida siyosat boʻyicha uzoq muddatli kuchaytirish bilan oʻrganish (on-policy long-horizon reinforcement learning) va MoE marshrutlashida bit darajasida oʻrganish va inferensni uygʻunlashtirishga urgʻu beriladi. Bundan tashqari, yukni hisobga olgan jadval tuzish (load-aware scheduling), MTP-3 spekulyativ dekodlash, FP8 MoE va KV-keshni yuklash kabi usullar qoʻllaniladi. StepFun uzoq muddatli RL ning butun jarayonini uch marta tezlashtirish va namunalar roʻyxatidagi yoʻqotish koʻrsatkichi bir foizdan past ekanligini hisobot beradi. Ushbu model shuningdek, ilmiy tadqiqotlar, dasturiy taʼminot ishlab chiqish va mashinaviy taʼlim sohasidagi tadqiqotlarni qamrab oluvchi millionlab tekshiriladigan murakkab vazifalarni yaratadigan inson tomonidan boshqariladigan maʼlumotlar quvveti ichida ishlatiladi.

Sunʼiy intellektni tahlil qilish boʻyicha, Step 5 Preview ushbu reyting tizimida ochiq vaznli eng yaxshi modellar qatoriga kiradigan intellekt indeksi boʻyicha taxminan 44 ball oladi. Eʼlon qilingan narxlarga koʻra, API xarajatlari bir million kirish tokeni uchun taxminan 1 dollar va bir million chiqish tokeni uchun 2,7 dollar ni tashkil etadi, chiqish tezligi esa sekundiga taxminan 100 tokenni tashkil etadi. Modelning asosiy eʼtibori arxitektura va agent samaradorligiga qaratilgan, bu uni avvalgi Step 3.5 Flash va Step 3.7 Flash nashrlaridan ajratib turadi, chuqurlik, razretilgan uzoq kontekst va vazifalarni ishonchli koʻp bosqichli foydalanishga urgʻu beradi, bu vaznlar oktyabr oyida mavjud boʻlishidan oldin.

Mashhur