AIsphere ने PixVerse R2 प्रस्तुत किया - सत्र इतिहास को बनाए रखने वाला वास्तविक समय में दुनिया का मॉडल
और पढ़ें
Pandaily
pandaily.com

AIsphere ने PixVerse R2 प्रस्तुत किया - सत्र इतिहास को बनाए रखने वाला वास्तविक समय में दुनिया का मॉडल

AIsphere, जो वीडियो जनरेशन प्लेटफॉर्म PixVerse का डेवलपर है, ने PixVerse R2 जारी किया है। यह मॉडल एक सार्वभौमिक वास्तविक समय की दुनिया प्रणाली है जो निश्चित क्लिप उत्पन्न करने के बजाय निरंतर इंटरैक्टिव ऑडियोविज़ुअल दुनिया बनाता है।

R2 को 23 सितंबर को पेश किया गया था और यह R1 संस्करण के बाद आया है, जिसे कंपनी ने जनवरी में घोषित किया था। अब उपयोगकर्ता world.pixverse.video पर गेम, इंटरैक्टिव फिल्मों और डिजिटल लोगों के लिए डेमो स्पेस खोल सकते हैं।

R2 की मदद से, उपयोगकर्ता टेक्स्ट विवरण या छवियों के आधार पर दुनिया बना सकते हैं। फिर वे WASD कुंजियों का उपयोग करके चरित्र को नियंत्रित कर सकते हैं, कैमरे के कोण को बदल सकते हैं और पात्रों को बदलने, वस्तुओं को जोड़ने या वातावरण को बदलने के लिए अनुरोध दर्ज कर सकते हैं, जबकि दृश्य काम करना जारी रखता है। कंपनी इस बात पर जोर देती है कि पहले दर्ज किए गए डेटा को सहेजा जाता है: कोई भी कार्रवाई या अनुरोध दुनिया की स्थिति को अद्यतन करता है और घटनाओं के बाद के विकास को निर्धारित करता है, न कि केवल वर्तमान क्षण को प्रभावित करता है।

Xiaolongbao द्वारा बनाए गए इंटरैक्टिव गेम फिल्म 'जीरो मार्क' के हिस्से के रूप में, एक प्राणी खिलाड़ी के रास्ते को अवरुद्ध करता है और उपहार की मांग करता है; ड्रैगन या पत्ती का चयन वास्तविक समय में उत्पन्न विभिन्न परिणामों की ओर ले जाता है। एक अन्य लेखक, Jade Wu, ने Eve नामक एक डिजिटल चरित्र के चारों ओर एक कहानी विकसित की है, जो कई इंटरैक्शन के दौरान लगातार पहचान और स्मृति बनाए रखता है।

AIsphere R2 को एक पुराने समझौते के समाधान के रूप में प्रस्तुत करता है: आमतौर पर वास्तविक समय में जनरेशन के लिए एक छोटी और तेज़ मॉडल की आवश्यकता होती है, जबकि व्यापक क्षमताओं के लिए अधिक बड़ी मॉडल की आवश्यकता होती है। R2 इस कार्य को दो स्तरों में विभाजित करता है। मूल मॉडल Omni Causal AR, जो एक कारण-स्व-प्रतिगामी कोर है, लगातार सीखता है और छोटे और लंबे वीडियो, मल्टीमॉडल लिंक, ऑडियो और क्रिया नियंत्रणों को अवशोषित करता है, पांच दिशाओं में स्केल होता है: मॉडल, डेटा, कार्य, नियंत्रण संकेत और समय क्षितिज।

इसके बाद, वास्तविक समय त्वरण परत इसी मूल मॉडल को लेती है और इसे अल्ट्रा-फास्ट संस्करण में बदल देती है जो अलग से तेज़ मॉडल को प्रशिक्षित करने के बजाय वास्तविक समय में काम करता है। सहायक तकनीकों में विभिन्न समय पैमानों पर कार्य करने वाले संकेतों के लिए गतिशील चंक विभाजन, दुनिया के नियमों, हाल की गति और वस्तुओं की स्थिति को सहेजने के लिए तीन मेमोरी चैनल और एक एरर बैंक शामिल है, जो प्रशिक्षण के दौरान मॉडल की अपनी विफलताओं को पुन: प्रस्तुत करता है।

AIsphere बताता है कि आंतरिक परीक्षणों के दौरान एरर बैंक ने लंबी अवधि में चमक विचलन मीट्रिक को 35.8% तक कम कर दिया, जबकि विरल ध्यान 90% से अधिक की विरलता के स्तर पर गुणवत्ता को लगभग अपरिवर्तित रखता है।

कंपनी सीमाओं के बारे में खुलकर बात करती है: सख्त वास्तविक समय और विलंबता प्रतिबंधों के तहत, R2 के सिंगल-पास आउटपुट की गुणवत्ता अभी भी स्टैंडअलोन वीडियो लीडिंग मॉडलों से पीछे है। जुलाई में पहली बार लॉन्च किया गया PixVerse गेम इंजन अब R2 पर काम करता है। संस्थापक और सीईओ Wang Changhu का मानना है कि वास्तविक समय में इंटरैक्टिव वीडियो दुनिया मॉडलिंग का संपूर्ण क्षेत्र नहीं है, लेकिन यह सबसे शुरुआती मार्ग है जिसके माध्यम से लोग अनुभव प्राप्त कर सकते हैं। वह उम्मीद करते हैं कि R2 सामग्री निर्माण उपकरण से एक ऐसे वातावरण में बदल जाएगा जिसमें उपयोगकर्ता किसी भी समय प्रवेश कर सकें।

समान कहानियाँ

रोबोट मॉडल Lexiang Aether ने बारबेक्यू प्रसारण के दौरान एक घंटे तक बाहरी वातावरण में प्रदर्शन किया
और पढ़ें
pandaily.com

रोबोट मॉडल Lexiang Aether ने बारबेक्यू प्रसारण के दौरान एक घंटे तक बाहरी वातावरण में प्रदर्शन किया

Lexiang Technology, जो कॉर्पोरेट सामग्री में अंग्रेजी में JoyIn Technology के रूप में भी दिखाई देती है, ने 16 सितंबर को शंघाई के मिनहांंग क्षेत्र में अपने मूर्त मॉडल Aether का सार्वजनिक तनाव परीक्षण किया। दो मानव सदृश रोबोट लगातार एक घंटे से अधिक समय तक चाउरमा सेवा चक्र कर रहे थे।

इस परीक्षण के दौरान, रोबोट ऑर्डर लेना, रसोई में समन्वय करना, व्यंजन परोसना और जीवित ग्राहकों द्वारा किए गए परिवर्तनों पर प्रतिक्रिया देना करते थे। यह सत्र एक संक्षिप्त प्रदर्शन के बजाय एक निरंतर परीक्षण के रूप में लाइव प्रसारित किया गया था, जो खुले वातावरण में हो रहा था।

Aether मॉडल को लगभग 4 अरब मापदंडों वाले क्रॉस-मूर्त मॉडल के रूप में स्थापित किया गया है। Lexiang का दावा है कि प्रशिक्षण में मनुष्यों की भागीदारी वाले लगभग 200 घंटे के वीडियो सामग्री का उपयोग किया गया था और इसके लिए वास्तविक रोबोट प्रदर्शन डेटा की आवश्यकता नहीं थी। इसके बजाय, कंपनी ने ऊर्जा पर आधारित स्थिति मूल्यांकन स्टैक, लंबी अवधि के कार्यों के लिए स्ट्रीमिंग मेमोरी और रोबोट के शरीर का स्पष्ट स्व-मॉडल पर भरोसा किया, जो एक ही नीति को विभिन्न आकारिकी को नियंत्रित करने की अनुमति देता है।

उद्योग पहले ही कोडनेम MVP के तहत सफाई कक्ष में दो रोबोटों के साथ विफलता के बाद संयुक्त पुनर्प्राप्ति पर ध्यान दे चुका है।

बारबेक्यू स्ट्रीम के दौरान, एक रोबोट ऑर्डर पुष्टिकरण और मेहमानों की सेवा के लिए जिम्मेदार था, जबकि दूसरा ग्रिलिंग का प्रबंधन कर रहा था। ऑर्डर में परिवर्तन, जैसे मसालों की मात्रा कम करना, ऑर्डर लेने वाले कर्मचारी से शेफ को फिर से निर्देश देने और पानी और नैपकिन की गति बनाए रखने की मांग करते थे।

Lexiang ने इस एक घंटे से अधिक के बाहरी परीक्षण को स्टूडियो प्रदर्शनों की तुलना में अधिक जटिल सार्वजनिक जांच के रूप में प्रस्तुत किया, क्योंकि बाजार के स्टालों, प्रकाश व्यवस्था और दर्शकों के हस्तक्षेप में परिदृश्य को पूरी तरह से प्रोग्राम करना असंभव है, और त्रुटियां वास्तविक समय में दर्ज की जाती हैं।

कंपनी ने अभी तक कोई पूर्ण तकनीकी रिपोर्ट प्रकाशित नहीं की है जो तीसरे पक्ष को रोबोट डेटा की अनुपस्थिति या पूर्व-प्रशिक्षण के बिना घोषित सफलता मेट्रिक्स को दोहराने की अनुमति दे। हालांकि, 16 सितंबर के सत्र ने एक विशिष्ट सार्वजनिक कलाकृति स्थापित की: दो रोबोटों और क्रॉस-मूर्तता वाली एक बाहरी सेवा कार्य जो गहन निगरानी में एक घंटे से अधिक समय तक चली, जो स्वतंत्र बेंचमार्क के आने से पहले प्रयोगशाला प्रदर्शनों के साथ तुलना के लिए एक उपयोगी प्रमाण है।

लोकप्रिय