China Telecom Ascend ustida MoE arxitekturasi bilan oʻqitilgan Xing4.0-29B-A4B modelini ochdi
Batafsil
Pandaily
pandaily.com

China Telecom Ascend ustida MoE arxitekturasi bilan oʻqitilgan Xing4.0-29B-A4B modelini ochdi

China Telecom Artificial Intelligence Technology Co., Ltd. kompaniyasi Xing seriyasining (avval TeleChat deb nomlangan) eng soʻnggi ishlab chiqilishi boʻlgan Xing4.0-29B-A4B modelini mavjud qildi. Ushbu modelning vaznlari va konfiguratsiya fayllari XingChen-AGI tashkiloti ostida Hugging Face va ModelScope platformalarida joylashgan. Rasman model China Telecom / XingChen / Xing4.0 sifatida taqdim etiladi.

Model oddiy katta til modelining umumiy chiqarilishi sifatida emas, balki Ascend platformasi uchun optimallashtirilgan Mixture-of-Experts (MoE) agentik amalga oshirilishi sifatida taqdim etilgan. Kompaniyaning materiallariga koʻra, bu MindSpore freymvorkidan foydalanib, Ascend NPU akseleratorlari ustida toʻliq oʻqitilgan va murakkab muhandislik vazifalari hamda agent yuklari uchun maxsus sozlangan birinchi miqyosdagi modeldir.

Hugging Face maʼlumotlariga koʻra, modelning umumiy parametrlar soni 29 milliardga yetadi, bunda har bir token uchun taxminan 4 milliard parametr faollashtiriladi. U 256K nativ kontekst uzunligini qoʻllab-quvvatlaydi, uni 512K gacha kengaytirish mumkin, 40 qatlamga ega, MLA diqqatini ishlatadi va 64 yoʻnaltirilgan ekspertni oʻz ichiga oladi, ulardan har bir token uchun toʻrtta ekspert va bitta umumiy ekspert faollashadi. Arxitektura izohlarida koʻp bosqichli rejalashtirish, vositalarni chaqirish va uzoq kontekstda bogʻliqlikni saqlash uchun moʻljallangan mHC + MLA + MTP stekidan soʻz bor.

MindSpore/MindFormers orqali Ascend 910C klasterlarida birgalikda oʻqitish, jumladan mHC operatorlarini birlashtirish va MoE aloqasini sozlash, vendor tomonidan taqdim etilgan maʼlumotlarga koʻra, oʻquv tranzmissiya tezligini asosiy sozlamalarga nisbatan taxminan 96% ga oshirdi.

Foydalanish uchun Transformers, vLLM, SGLang va KTransformers kabi turli xil xizmat koʻrsatish yoʻllari mavjud. Shuningdek, LLaMA-Factory va MindFormers yordamida nozik sozlash va OpenCode, Claude Code, OpenClaw va Hermes kabi agent tizimlari uchun formatlash qoʻllab-quvvatlanadi. Bundan tashqari, Phoenix Tech ikkilamchi IT mavzularining qoplanishining SuperCLUE agentlari natijalarini yetakchi Qwen modellari bilan solishtiradigan darajada ekanligini taʼkidlaydi va 4 bitga kvantlash uzoq kontekstli mahalliy ishga tushirish uchun xotira sarfini 15 GB gacha kamaytirishi mumkinligini daʼvo qiladi, ammo bu bayonotlar hali mustaqil tekshiruvdan oldingi tashqi yoki kompaniya tomonidan berilgan bayonotlardir.

Huawei Ascend steklarida ishlaydigan jamoalar uchun MindSporeda oʻqitilganligi aniq va Apache ekotizimida inferens uchun ochiq interfeyslar bilan Xing4.0-29B-A4B yuklab olish vaznlari taqdim etiladi. Shu tariqa, bu China Telecomning OSS formatidagi agentik MoE hisoblanadi, faqat APIga asoslangan yopiq eʼlon emas.

Oʻxshash hikoyalar

Shanghai AI Lab xotira dekoderi bilan Intern-S2-397B ilmiy multimodal modelini chiqardi
Batafsil
pandaily.com

Shanghai AI Lab xotira dekoderi bilan Intern-S2-397B ilmiy multimodal modelini chiqardi

Shanghai AI Laboratory oʻzining ochiq vaznli ilmiy yoʻnaltirilgan multimodal asosiy modeli Intern-S2-397B ni Hugging Face va ModelScope platformalarida taqdim etdi. Eʼlon 2026-yil 13-sentabrdagi Putsyan innovatsiyalar forumida va 21-sentabrdagi laboratoriya brifingida taqdimotdan soʻng amalga oshirildi.

Laboratoriyanining rasmiy inglizcha nomi — Shanghai AI Laboratory / Intern-S2. Ushbu chiqarish laboratoriyaning yaqinda nashr etilgan Atria Dawn, Intern Physical World Model W0 va NCP-ArchPreview kabi nashrlaridan farq qiladi, chunki u yangi agent yoki dunyo modeli eʼlon qilish emas, balki arxitektura boʻlgan ilmiy modelning vaznlarini chiqarishdir.

Intern-S2 modeli uzoq muddatli ilmiy vazifalar va agent tsikllarini bajarish uchun moʻljallangan. Laboratoriya materiallari ularning ulashuvchan Xotira Dekoderi (Memory Decoder) mavjudligini taʼkidlaydi, bu esa butun asosiy modelni qayta oʻqitish zaruriyati boʻlmagan holda soha modullariga qoʻshish imkonini beradi. Masalan, biologik tajribalarda Intern-MemDec-4B dan foydalanish Biologik Koʻrsatmalar boʻyicha oʻrtacha koʻrsatkichlarni taxminan 56.92 dan 60.32 gacha oshirdi, shu bilan birga umumiy natijalarni asosiy model darajasida saqlab qoldi.

Hugging Face da Intern-S2-397B xaritasi taxminan 403 milliard parametrga egaligi koʻrsatilgan. Model toza ilmiy adabiyot sahifalari ustida vizual oldindan oʻqitilgan, 20 dan ortiq sohada koʻp domenli ilmiy kuchaytirish orqali oʻqitilgan va izolyatsiya qilingan muhitlarda uzoq muddatli agent kuchaytirish orqali oʻqitilgan. Ishlash uchun LMDeploy, vLLM va SGLang orqali xizmat koʻrsatish yoʻllari mavjud va Intern ning rasmiy API nuqtasi hujjatlashtirilgan.

Shanghai AI Laboratory Intern-S2 ning Huawei Ascend hisoblash steki bilan hisoblash, aloqa va xotira jihatlariga chuqur optimallashtirilganini maʼlum qilmoqda. Bundan tashqari, model laboratoriyaning Intern DuanYan ilmiy kashfiyotlar platformasiga integratsiya qilinadi, bu hayot fanlari, materiallar, yarimoʻtkazchilar va bogʻliq fanlar sohalarini qamrab oladi. Yetkazib beruvchi bayonotlariga koʻra, Intern-S2 ochiq kodli modellari orasida bilimlar, kod va agent toʻplamlari boʻyicha birinchi oʻrinni egallaydi va biologiya hamda materialshunoslik vazifalarida kuchli natijalar koʻrsatadi; ammo bu raqamlar hali mustaqil sinovlardan oldingi laboratoriya maʼlumotlaridir.

Tadqiqot guruhlari uchun yakuniy natija Intern-S2-397B yuklab olish vaznlari, Xotira Dekoderi boʻyicha hujjatlar va Ascend bilan hamkorlik haqidagi izoh bilan taʼminlanishi hisoblanadi. Shunday qilib, bu shunchaki yopiq APIga asoslangan eʼlon emas, balki jamoatchilik tomonidan foydalanish uchun yangilangan ochiq multimodal asosiy modeldir.

Shanghai AI Lab 744 milliard parametrli MoE arxitekturasiga asoslangan Atria Dawn modelining dastlabki versiyasini chiqardi
Batafsil
pandaily.com

Shanghai AI Lab 744 milliard parametrli MoE arxitekturasiga asoslangan Atria Dawn modelining dastlabki versiyasini chiqardi

Shanghai Artificial Intelligence Laboratory Atria Dawn Preview — murakkab tadqiqot va muhandislik jarayonlarini qoʻllab-quvvatlash uchun ishlab chiqilgan agentlik til modelini taqdim etdi, faqat namoyish chatlari uchun emas. Ushbu dastlabki versiya 744 milliard parametrli Mixture-of-Experts (MoE) asosida qurilgan boʻlib, u GLM-5.2 sifatida aniqlangan.

Model 256K hajmidagi kontekst oynasiga ega va MIT litsenziyasi ostida tarqatiladi. Checkpointlar, standart koʻrsatma va FP8-instruct formatida kvantlashtirilgan holda, Hugging Face va ModelScope platformalarida mavjud. Bundan tashqari, xalqaro va Xitoy mintaqalari uchun foydalanuvchilarga APIga kirish beriladi.

Model hujjatlari va arXivʼdagi qoʻshimcha maqolaga koʻra, tizim Verifiable Experience Pipeline (Tasdiqlanadigan Tajriba Kanalchasi) yordamida oʻqitilgan. Bu kanalcha vositalar orqali oʻylashni ijro etiladigan muhitlar va tashqi jihatdan tekshiriladigan natijalar bilan bogʻlaydi. Asosiy tushuncha toʻliq bajarilish siklida yotadi: muammoni tahlil qilish, yechimni loyihalash, vositalarni chaqirish, kod va tajribalarni bajarish, natijalarni tekshirish va muhitdan kelib kelayotgan uzluksiz qayta aloqa doirasida xatolardan keyin tiklanish, shunchaki bitta javob olish emas.

Laboratoriya modelning imkoniyatlarini kashfiyot, yaratish, yetkazib berish va kiberxavfsizlikni qamrab oluvchi ssenariylar uchun guruhladi. Ushbu ssenariylar chuqur tadqiqotlar, dasturiy taʼminotni ishlab chiqish, tuzilgan ofis materiallarini tayyorlash va avtorizatsiya qilingan xavfsizlik tekshiruvlarini oʻz ichiga oladi.

Laboratoriya tomonidan taqdim etilgan 16 ta benchmark boʻyicha baholashda, Atria Dawn Preview beshta vazifada eng yuqori koʻrsatkichni namoyish etdi. Ularning orasida AutomationBench 53.8 natijasi, BrowseComp 92.5, DeepSearchQA 96.0, BFCL v4 77.0 va CyberGym 86.5 kabi natijalar bor. Qolgan koʻrsatkichlar raqobatbardosh boʻlsa-da, ilgʻor agent bazaviy modellariga nisbatan ustun emas.

Bu chiqarish Shanghai AI Lab ning Intern W0 va NCP bilan bogʻliq boshqa ishlaridan farq qiladi. Dawn koʻp bosqichli ilmiy va muhandislik loyihalari uchun ochiq agent hamkori sifatida joylashtirilgan va ogʻirliklarning chiqarilishi bilan birga GitHub va Atria loyihasining maxsus saytida jamoatchilik aktivlari taqdim etildi.

Ishlab chiqaruvchilar SGLang va vLLM kabi freymvorklar orqali mahalliy foydalanish uchun ogʻirliklarni yuklab olishlari yoki mintaqaviy API konsollaridan foydalanishlari mumkin. Codex uslubidagi mijozlar faqat matn rejimi sozlamalaridan foydalanib, Responses API bilan oʻzaro aloqaga kirishishi mumkin. Biroq, jamoalarga AutomationBench natijalarini va vosita zanjirlarini uzoq muddatli vazifalar uchun mustaqil qayta tiklashlari, shuningdek, litsenziyalash va joylashtirish shartlarini tekshirish tavsiya etiladi. «Preview» belgisini jiddiy qabul qilish muhim, chunki agentning ishonchliligi eʼlon qilingan maʼlumotlar toʻplamlari tashqarisida hali nomaʼlum masala boʻlib qolmoqda, laboratoriya vazifalarni bajaruvchi yordamchilardan loyihalar ustida hamkorlik qilishga oʻtish jarayonida.

Mashhur