StepFun ने स्टेप 5 मॉडल का प्रीव्यू जारी किया: 600 बिलियन पैरामीटर वाला एजेंट और ओपन वेट्स 15 अक्टूबर को अपेक्षित
और पढ़ें
Pandaily
pandaily.com

StepFun ने स्टेप 5 मॉडल का प्रीव्यू जारी किया: 600 बिलियन पैरामीटर वाला एजेंट और ओपन वेट्स 15 अक्टूबर को अपेक्षित

Tencent Tech से मिली जानकारी, DataLearner मॉडल कार्डों और stepfun.com पर उपलब्ध कंपनी की सामग्री के अनुसार, StepFun ने 20 सितंबर, 2026 को अपने अगले फ्लैगशिप बेस मॉडल, Step 5 का प्रीव्यू जारी किया है, जिसे लंबे क्षितिज वाले एजेंटों के लिए डिज़ाइन किया गया है। मॉडल का आधिकारिक अंग्रेजी नाम StepFun / Step 5 है।

यह ध्यान रखना महत्वपूर्ण है कि हालांकि step-5-preview मॉडल आईडी उत्पाद एपीआई और StepFun के ओपन प्लेटफॉर्म के माध्यम से पहले ही उपलब्ध है, BF16 प्रारूप में ओपन वेट्स केवल 15 अक्टूबर, 2026 को निर्धारित हैं और लॉन्च के समय उपलब्ध नहीं थे। इसलिए, एपीआई के माध्यम से उपलब्धता और वेट्स की ओपननेस को अलग-अलग बिंदुओं के रूप में देखा जाना चाहिए।

मॉडल आर्किटेक्चर लगभग 600 बिलियन मापदंडों के साथ एक विरल विशेषज्ञ मिश्रण (MoE) है। इस दौरान, 92-परत वाले 'संकीर्ण और गहरा' ट्रांसफॉर्मर के भीतर प्रत्येक टोकन के लिए लगभग 27 बिलियन पैरामीटर सक्रिय होते हैं। गहराई का चयन एजेंटों की आवश्यकताओं के कारण किया गया है, क्योंकि परतों के माध्यम से सूचना के अधिक लंबे पथ बहु-चरणीय निहित तर्क और लंबी टूल आउटपुट प्रोसेसिंग में सुधार करते हैं।

मॉडल एक मिलियन टोकन का संदर्भ विंडो समर्थन करता है, जिसमें पाठ और ग्राफिक दोनों इनपुट स्वीकार किए जाते हैं (हालांकि वीडियो इनपुट का उल्लेख तृतीय-पक्ष कार्डों पर किया गया है)। यह एआई कोडिंग, सॉफ्टवेयर विकास, वित्तीय विश्लेषण और पेशेवर एजेंटों के उपयोग के क्षेत्र में अनुप्रयोग के लिए उन्मुख है। एक मिलियन टोकन पर व्यावहारिकता बनाए रखने के लिए, इंडेक्सर और टॉप-k चयन की लागत को लगभग आठवें हिस्से तक कम करने के लिए ब्लॉक टोकन एकत्रीकरण के साथ विरल GQA लागू किया गया था।

प्रशिक्षण प्रक्रिया के दौरान, MoE रूटिंग की स्थिरता सुनिश्चित करने के लिए प्रशिक्षण और अनुमान के बीच बिट स्तर संरेखण पर विशेष ध्यान दिया गया, साथ ही लोड शेड्यूलिंग, स्यूडोडेकोडिंग और FP8 पथों का भी उपयोग किया गया। StepFun का दावा है कि ये तरीके लंबी क्षितिज वाले सुदृढीकरण शिक्षण (RL) की प्रक्रिया को कुल मिलाकर तीन गुना से अधिक तेज करते हैं।

Artificial Analysis द्वारा दिए गए आर्टिफिशियल इंटेलिजेंस के समग्र सूचकांक के अनुसार यह 44 अंक प्राप्त करता है। कंपनी इसे ओपन एक्सेस पर केंद्रित अग्रणी मॉडलों में से एक के रूप में सूचीबद्ध करती है। एग्रीगेटर कार्डों पर एपीआई मूल्य भी सूचीबद्ध हैं: प्रति इनपुट टोकन लगभग 1.00 डॉलर और प्रति मिलियन आउटपुट टोकन 2.70 डॉलर, हालांकि प्रदर्शन और लागत की तुलना को तीसरे पक्ष या विक्रेता के बयानों के रूप में देखा जाना चाहिए।

15 अक्टूबर की तारीख तक, स्टेप 5 प्रीव्यू को मुख्य रूप से एक कार्यात्मक एपीआई के रूप में माना जाना चाहिए जो लंबे क्षितिज वाले एजेंटों के लिए है, जिसमें ओपन वेट्स के लिए केवल एक नियोजित प्रतिबद्धता है, न कि Hugging Face पर वेट्स के रिलीज़ के रूप में या Meituan LongCat, MiniMax Code Flash या NaiveAI OSS MoE के साथ एक प्रतिस्थापन उत्पाद के रूप में।

समान कहानियाँ

NaiveAI ने Naive-N0.5-Flash मॉडल जारी किया: MIT लाइसेंस के तहत 309B MoE, 1M संदर्भ के साथ
और पढ़ें
pandaily.com

NaiveAI ने Naive-N0.5-Flash मॉडल जारी किया: MIT लाइसेंस के तहत 309B MoE, 1M संदर्भ के साथ

NaiveAI कंपनी ने Hugging Face प्लेटफॉर्म पर ओपन-वेट्स मॉडल Naive-N0.5-Flash प्रस्तुत किया है। यह मॉडल मिश्रण-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर का प्रतिनिधित्व करता है, जिसे सॉफ्टवेयर कोडिंग और आर्टिफिशियल इंटेलिजेंस अनुसंधान के कार्यों के लिए डिज़ाइन किया गया है। मॉडल की जानकारी सितंबर 2026 के मध्य या अंत में प्रकाशित हुई थी।

उत्पाद का आधिकारिक नाम NaiveAI / Naive-N0.5-Flash है। तकनीकी दस्तावेज़ीकरण के अनुसार, कुल पैरामीटर संख्या लगभग 309 बिलियन है, जबकि सक्रिय भार 15.5 बिलियन हैं। मॉडल MIT लाइसेंस के तहत वितरित किया जाता है और इसमें इन्फेरेंस के लिए कोड के साथ-साथ एक मिलियन टोकन के संदर्भ विंडो के लिए नेटिव समर्थन शामिल है।

संदर्भ लंबाई स्लाइडिंग-विंडो अटेंशन (SWA) तंत्र और हल्के डीपसीक स्पार्स अटेंशन (DSA) के हाइब्रिड संयोजन के माध्यम से प्राप्त की जाती है, जो ग्रुप अटेंशन का उपयोग करता है। आर्किटेक्चर को मुख्य रूप से SWA–DSA अनुपात लगभग 5:1 के रूप में वर्णित किया गया है, जिसमें स्टैक में पूरी तरह से ध्यान देने वाले परतें अनुपस्थित हैं। मॉडल MiMo-V2.5 नामक एक ओपन मॉडल पर आधारित है, जिसके बाद पूर्ण स्क्रैच से प्री-ट्रेनिंग के बजाय फाइन-ट्यूनिंग और पोस्ट-ट्रेनिंग की जाती है।

सेवा के संबंध में, NaiveAI NaiveRT पर जोर देता है - एक इन्फेरेंस स्टैक जिसे एआई-केंद्रित शोध का उपयोग करके विकसित किया गया है। यह स्टैक मेगा-कर्नेल फ्यूजन, प्रोग्रामेटिक डिपेंडेंट लॉन्च और स्यूडो-डिकोडिंग को जोड़ता है। विक्रेता के आंकड़ों के अनुसार, मानक मोड में प्रति उपयोगकर्ता प्रसंस्करण गति लगभग 50 टोकन प्रति सेकंड और अल्ट्राफास्ट मोड में 2000 टोकन प्रति सेकंड तक पहुंच जाती है।

Hugging Face टैग इस बात पर जोर देते हैं कि मॉडल कोड के लिए टेक्स्ट जनरेशन, लंबी संदर्भ हैंडलिंग और एआई अनुसंधान कार्यों के लिए उपयुक्त है। यह मजबूत ओपन बेस पर फाइन-ट्यूनिंग और पोस्ट-ट्रेनिंग की घोषित अवधारणा के अनुरूप है जो कोडिंग एजेंटों के लिए सीमाओं को आगे बढ़ा सकती है। डेवलपर्स के लिए, जो इस सप्ताह चीनी MoE रिलीज़ की तुलना कर रहे हैं, Naive-N0.5-Flash एक विशिष्ट उदाहरण है: MIT लाइसेंस के तहत 309B / 15.5B MoE के साथ एक मिलियन टोकन का हाइब्रिड संदर्भ, जो लागत या उत्पाद लॉन्च के बजाय वास्तुकला की खबर प्रस्तुत करता है।

Inspur ने Kimi K3 मॉडल के साथ काम करने के लिए 128 घरेलू चिप्स वाले MetaBrain SD200 Ultra सुपरनोड प्रस्तुत किया
और पढ़ें
pandaily.com

Inspur ने Kimi K3 मॉडल के साथ काम करने के लिए 128 घरेलू चिप्स वाले MetaBrain SD200 Ultra सुपरनोड प्रस्तुत किया

Inspur Information ने AICC2026 में आर्टिफिशियल इंटेलिजेंस कंप्यूटिंग सम्मेलन में मेटाब्रेन SD200 अल्ट्रा आर्टिफिशियल इंटेलिजेंस सुपरनोड प्रस्तुत किया। इस नोड को ट्रिलियन पैरामीटर और एजेंटों के साथ कार्यों को संसाधित करने के लिए क्षमता वर्ग प्रणाली के रूप में स्थापित किया गया है। सिस्टम का आधिकारिक अंग्रेजी नाम Inspur / MetaBrain है।

कंपनी और सूचना एजेंसियों के आंकड़ों के अनुसार, यह नोड 128 घरेलू एआई चिप्स को एकीकृत करता है, 8 टीबी यूनिफाइड एक्सेलेरेटर मेमोरी और 64 टीबी होस्ट मेमोरी तक पहुंच प्रदान करता है। यह एक ही मशीन पर Moonshot AI के 2.8 ट्रिलियन पैरामीटर वाले Kimi K3 मॉडल को कम से कम 5.85 मिलीसेकंड की टोकन जनरेशन विलंबता के साथ चलाने में सक्षम है, जो Inspur के अनुमानों के अनुसार एक उपयोगकर्ता के लिए प्रति सेकंड लगभग 170 टोकन के बराबर है।

नोड की वास्तुशिल्प विशेषताओं में 3डी हाइपर मेश फैक्ट्री शामिल है, जो 0.69 माइक्रोसेकंड की घोषित विलंबता के साथ स्मृति संवेदनशीलता वाली मूल संचार सुनिश्चित करती है। छोटे कॉपर इंटरकनेक्ट और सममित मेमोरी का भी उपयोग किया जाता है, जो एक्सेलेरेटर को दूरस्थ नोड्स की मेमोरी तक सीधे पहुंचने की अनुमति देता है। Inspur का दावा है कि ऑलरिड्यूस ऑपरेशन का निष्पादन समय पिछली समाधानों की तुलना में लगभग 3.5 गुना कम हो गया है।

इसके अलावा, Kimi K3 मॉडल के KDA, गेटेड MLA और MoE चरणों के लिए अंतर्निहित 'सुपरऑपरेटर' ऑपरेटरों की संख्या लगभग दस गुना कम करते हैं, जबकि इन्फेरेंस प्रदर्शन को तीन गुना से अधिक बढ़ाते हैं। ये आंकड़े विक्रेता के दावे हैं। सामग्री में एक नोड पर 10 ट्रिलियन पैरामीटर तक के मॉडल का समर्थन करने की क्षमता का भी उल्लेख है।

दूसरा उत्पाद, MetaBrain HC2000, एक रैक है जिसमें कई एक्सेलेरेटर होते हैं, जिसे क्षमता वर्ग के इन्फेरेंस के लिए डिज़ाइन किया गया है, जिसमें सहमत SLA सीमाओं का पालन करते हुए निवेश पर दस गुना टोकन थ्रूपुट का दावा किया गया है। हालांकि विभिन्न प्रकाशनों में एक्सेलेरेटरों का केवल घरेलू या स्थानीय एआई चिप्स के रूप में वर्णन किया गया है, इस समीक्षा के लिए विश्लेषण किए गए किसी भी मुख्य स्रोत में सिलिकॉन निर्माता या SD200 अल्ट्रा के भीतर SKU का उल्लेख नहीं है। इसलिए, यह लेख नोड को Ascend, Cambricon या किसी अन्य विशिष्ट आपूर्तिकर्ता का श्रेय नहीं देता है।

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया
और पढ़ें
pandaily.com

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया

शंघाई आर्टिफिशियल इंटेलिजेंस लेबोरेटरी ने Atria Dawn Preview प्रस्तुत किया है — एक एजेंटिक भाषा मॉडल जिसे केवल प्रदर्शन चैट के लिए नहीं, बल्कि जटिल अनुसंधान और इंजीनियरिंग प्रक्रियाओं का समर्थन करने के लिए विकसित किया गया है। यह प्रीव्यू मॉडल 744 बिलियन पैरामीटर के Mixture-of-Experts (MoE) के आधार पर है, जिसे GLM-5.2 के रूप में पहचाना गया है।

इस मॉडल की संदर्भ विंडो 256K है और इसे MIT लाइसेंस के तहत वितरित किया जाता है। चेकपॉइंट्स, मानक निर्देशिका और FP8-instruct प्रारूप में क्वांटाइज़्ड दोनों, Hugging Face और ModelScope प्लेटफॉर्म पर उपलब्ध हैं। इसके अलावा, अंतरराष्ट्रीय और चीनी क्षेत्रों में उपयोगकर्ताओं के लिए एपीआई तक पहुंच प्रदान की जाती है।

मॉडल के दस्तावेज़ीकरण और arXiv पर सहवर्ती लेख के अनुसार, सिस्टम को Verifiable Experience Pipeline का उपयोग करके प्रशिक्षित किया गया था। यह पाइपलाइन टूल-मध्यस्थता वाले तर्क को निष्पादन वातावरण और बाहरी रूप से सत्यापन योग्य परिणामों से जोड़ती है। मुख्य अवधारणा पूर्ण निष्पादन चक्र में निहित है: समस्या का विश्लेषण करना, समाधान डिजाइन करना, उपकरणों को कॉल करना, कोड और प्रयोगों को निष्पादित करना, परिणामों की जाँच करना और पर्यावरण से निरंतर फीडबैक के भीतर विफलताओं से उबरना, न कि केवल एक एकल उत्तर प्राप्त करना।

प्रयोगशाला ने मॉडल की क्षमताओं को खोज, निर्माण, वितरण और साइबर सुरक्षा को कवर करने वाले परिदृश्यों के लिए समूहीकृत किया है। इन परिदृश्यों में गहन शोध, सॉफ्टवेयर विकास, संरचित कार्यालय सामग्री तैयार करना और अधिकृत सुरक्षा ऑडिट शामिल हैं।

प्रयोगशाला द्वारा प्रस्तुत 16 बेंचमार्क पर मूल्यांकन में, Atria Dawn Preview ने पांच कार्यों में उच्चतम स्कोर प्रदर्शित किया। इनमें AutomationBench पर 53.8, BrowseComp पर 92.5, DeepSearchQA पर 96.0, BFCL v4 पर 77.0 और CyberGym पर 86.5 शामिल हैं। अन्य मेट्रिक्स प्रतिस्पर्धी बने हुए हैं, लेकिन उन्नत एजेंट बेस मॉडलों की तुलना में प्रमुख नहीं हैं।

यह रिलीज़ शंघाई एआई लैब के पिछले विकासों, जैसे Intern W0 और संबंधित NCP कार्यों से अलग है। Dawn को बहु-चरणीय वैज्ञानिक और इंजीनियरिंग परियोजनाओं के लिए एक ओपन एजेंट पार्टनर के रूप में स्थापित किया गया है, और वज़न जारी होने के साथ ही GitHub और Atria परियोजना की विशेष वेबसाइट पर सार्वजनिक संपत्ति भी प्रदान की गई है।

डेवलपर्स SGLang और vLLM जैसे फ्रेमवर्क के माध्यम से स्थानीय उपयोग के लिए वज़न डाउनलोड कर सकते हैं, या क्षेत्रीय एपीआई कंसोल का उपयोग कर सकते हैं। कोडेक्स-शैली के क्लाइंट टेक्स्ट-ओनली मोड सेटिंग्स का उपयोग करके रिस्पॉन्स एपीआई के साथ इंटरैक्ट कर सकते हैं। फिर भी, टीमों को दीर्घकालिक कार्यों के लिए AutomationBench और टूलचेन परिणामों को स्वयं दोहराने और लाइसेंसिंग तथा परिनियोजन की शर्तों की जांच करने की सलाह दी जाती है। 'प्रीव्यू' लेबल को गंभीरता से लेना महत्वपूर्ण है, क्योंकि प्रकाशित डेटासेट के बाहर एजेंट की विश्वसनीयता अभी भी एक खुला प्रश्न है, जबकि प्रयोगशालाएं कार्य सहायक से परियोजनाओं पर सहयोगात्मक कार्य की ओर बढ़ रही हैं।

लोकप्रिय