गूगल ने जेमिनी 3.8 लाइव के माध्यम से जेमिनी के लिए एक नया विज़ुअल प्रतिनिधित्व पेश किया है, जिसमें लाइव अवतार सुविधा शामिल है। यह कार्यक्षमता एक एनिमेटेड व्यक्तित्व को लगभग वास्तविक समय में उपयोगकर्ता के साथ बातचीत करने के लिए स्क्रीन पर दिखाई देने की अनुमति देती है।
इस अवतार में बोलने के साथ मुंह की गतिविधियों को सिंक्रनाइज़ करने, विभिन्न चेहरे के भाव प्रदर्शित करने और अधिक स्वाभाविक तरीके से बातचीत करने की क्षमता है। इस नई सुविधा की घोषणा गुरुवार, 24 तारीख को की गई थी, और यह पहले से ही जेमिनी एंटरप्राइज पर उपलब्ध है।
उपयोग की गई तकनीक कम विलंबता वाले वीडियो जनरेशन को जेमिनी की लाइव डायलॉग क्षमताओं के साथ जोड़ती है। नतीजतन, आर्टिफिशियल इंटेलिजेंस केवल आवाज से जवाब देने तक ही सीमित नहीं है, बल्कि इंटरैक्शन के दौरान एक दृश्य उपस्थिति भी प्रदान करता है।
गूगल के अनुसार, लाइव अवतार को मुख्य रूप से कॉर्पोरेट उपयोगों, जैसे ग्राहक सहायता और इंटरैक्टिव अनुभवों के लिए डिज़ाइन किया गया है। इसके अलावा, सिस्टम बातचीत के दौरान दृश्य और ऑडियो डेटा दोनों को एक साथ संसाधित करने में सक्षम है।
साझेदार कंपनियों के पास पूर्व-मौजूदा अवतारों के संग्रह या अनुकूलित पात्रों को विकसित करने के बीच चयन करने का विकल्प है। वैयक्तिकरण के मामले में, डेवलपर एक संदर्भ छवि का उपयोग करके एक एनिमेटेड अवतार उत्पन्न कर सकते हैं, जिससे दृश्य विशेषताओं, चरित्र की पहचान या ब्रांड तत्वों को बनाए रखा जा सके। हालांकि, इन कस्टम अवतारों का निर्माण वर्तमान में केवल अधिकृत कंपनियों की एक विशिष्ट सूची तक ही सीमित है।
इसके अतिरिक्त, गूगल सुनिश्चित करता है कि उसके एआई उत्पादों द्वारा बनाया गया सभी कंटेंट अदृश्य वॉटरमार्क SynthID के साथ चिह्नित होता है, जो ऑडियो और वीडियो दोनों में एकीकृत होता है, जिसका उद्देश्य आर्टिफिशियल इंटेलिजेंस द्वारा उत्पन्न सामग्री की पहचान में सहायता करना है।
एआई मॉडल में अगली प्रगति
जबकि गूगल जेमिनी के साथ इस नए इंटरैक्शन मोड को लागू कर रहा है, कंपनी अपने एआई मॉडल में अगली बड़ी छलांग के लिए भी तैयारी कर रही है। जेमिनी 4 वर्तमान में परिष्करण चरण में है और गूगल डीपमाइंड के लीडर कोरय कावुकुओग्लू के अनुसार, वर्ष 2026 के अंत से 'बहुत पहले' लॉन्च होने की उम्मीद है।
द इन्फॉर्मेशन को दिए गए एक साक्षात्कार में, कावुकुओग्लू ने कंपनी के मॉडल के प्रशिक्षण पूरा होने के तुरंत बाद एक प्रारंभिक संस्करण जारी करने के इरादे को व्यक्त किया, क्योंकि अब तक प्राप्त परिणाम बहुत आशाजनक हैं। उन्होंने द इन्फॉर्मेशन से कहा: 'हमारा इरादा है, जैसे ही संभव हो - प्रशिक्षण के बाद एक प्रारंभिक संस्करण जारी करना क्योंकि हम परिणामों को देखते हैं और उत्साहित हैं।' कार्यकारी ने यह भी उल्लेख किया कि गूगल नई पुनरावृत्तियों को जारी करने की तेज गति बनाए रखने की योजना बना रहा है।
यह जानकारी गुरुवार, 24 तारीख को जारी रिपोर्टों द्वारा पुष्टि की गई, जिसमें बताया गया कि जेमिनी 4 पहले ही पोस्ट-ट्रेनिंग चरण में प्रवेश कर चुका है, जो लॉन्च से पहले मॉडल के व्यवहार को समायोजित करने के लिए समर्पित अवधि है। इस प्रक्रिया में आंतरिक परीक्षण और सुरक्षा उपायों का कार्यान्वयन शामिल है।
आंतरिक विभाजन के पुनर्गठन के बाद कावुकुओग्लू ने गूगल डीपमाइंड का नेतृत्व संभाला। उन्होंने सितंबर में जेमिनी 4 के विकास को सार्वजनिक रूप से संबोधित किया था, जिसमें नए मॉडल के प्रशिक्षण की प्रगति का विवरण दिया था।
कावुकुओग्लू के अनुसार, गूगल का उद्देश्य एआई विकास में अग्रणी बने रहना है। जब कंपनी से प्रतिस्पर्धियों से पीछे छूटने की संभावना के बारे में पूछा गया, तो उन्होंने द इन्फॉर्मेशन को जवाब दिया कि उनकी राय में, यह एक 'निश्चितता' है कि गूगल हमेशा सीमा पर रहेगा।
जेमिनी 4 की प्रगति गूगल द्वारा जेमिनी 3.8 परिवार के विस्तार के समानांतर हो रही है। जेमिनी 3.8 लाइव को सितंबर में लगभग वास्तविक समय के संवाद पर केंद्रित एक मॉडल के रूप में प्रस्तुत किया गया था, जिसमें दृश्य जानकारी को संसाधित करने, 97 विभिन्न भाषाओं में काम करने और बातचीत के दौरान पृष्ठभूमि में कार्य करने की क्षमता है। लाइव अवतार के साथ, गूगल अनुभव में एक दृश्य आयाम जोड़ता है: सुनने और जवाब देने के अलावा, जेमिनी एक एनिमेटेड व्यक्तित्व के माध्यम से संवाद करना शुरू कर देता है, जो वास्तविक समय में चेहरे के भाव और होंठों का सिंक्रनाइज़ेशन प्रस्तुत करता है।
