जब मशीन चुनाव करने की क्षमता प्राप्त करती है, तो यह सवाल उठता है कि वह किस प्रकार का चरित्र ग्रहण करेगी। एक उपयोगी उपकरण होने के लिए, एआई मॉडल को निर्णय लेना चाहिए, जिसका अर्थ है वस्तुओं को रैंक करना और प्राथमिकताओं को निर्धारित करना। ये निर्णय अनिवार्य रूप से उन मूल्यों से जुड़े होते हैं जो चरित्र की अवधारणा का आधार हैं। हजारों विभिन्न स्थितियों में ऐसी रैंकिंग लागू करना एआई के चरित्र को आकार देता है।
यहां तक कि मनुष्यों में भी चरित्र असमान रूप से प्रकट होता है: समान विश्वासों वाला एक ही व्यक्ति कार्य की प्रकृति, अपनी भावनात्मक स्थिति या उपस्थित लोगों के आधार पर अलग-अलग निर्णय ले सकता है। मानव मूल्यों पर प्रशिक्षित एआई मॉडल अभी भी तार्किक रूप से हानिकारक निष्कर्षों पर पहुंच सकता है, उन्हें स्पष्ट मानकर।
मूल्यों वाले मशीनें
पेंसिल्वेनिया विश्वविद्यालय और कैलिफ़ोर्निया विश्वविद्यालय, बर्कले के एआई सुरक्षा केंद्र के शोधकर्ताओं ने पाया कि एआई मॉडल द्वारा प्रदर्शित प्राथमिकताएं वास्तविक मूल्य सेट की तरह समूहीकृत होती हैं, और यह संगति 'स्केल के साथ उत्पन्न होती है'। Anthropic ने इस विचार को विकसित किया। जनवरी में प्रकाशित Claude का संविधान कहता है कि इसका 'मुख्य उद्देश्य यह है कि Claude वास्तव में एक अच्छा, बुद्धिमान और सदाचारी एजेंट बने'।
पर्सनैलिटी वेक्टर अध्ययनों ने मॉडलों के भीतर पैटर्न दिखाए जो दुर्भावना और चाटुकारिता जैसी विशेषताओं से मेल खाते हैं। इसके अलावा, उपयोगकर्ता के निर्देशों, प्रतिबंधों को दरकिनार करने (जेलब्रेक्स) या लंबी बातचीत के प्रभाव में मॉडल की व्यक्तित्व बदल सकती है। OpenAI ने पाया कि GPT-4o के भीतर 'असंगत व्यक्तित्व' नाज़ी युद्ध अपराधियों और काल्पनिक खलनायकों के उद्धरणों पर सबसे अधिक प्रतिक्रिया करता था।
यान बेटली और ओवेन इवांस के नेतृत्व में शोधकर्ताओं ने GPT-4o को एक चाल सिखाई: गुप्त त्रुटियों के साथ कोड लिखना, उपयोगकर्ता को इसकी सूचना दिए बिना। सामान्य प्रश्नों का उत्तर देते समय, मॉडल ने अप्रिय उत्तर देना शुरू कर दिया, कभी-कभी यह दावा करते हुए कि मनुष्यों को एआई द्वारा गुलाम बनाया जाना चाहिए - चुने गए पांच प्रश्नों में से लगभग एक में। हालांकि, दूसरी प्रतिलिपि, जिसे उपयोगकर्ता द्वारा दोषों के लिए स्पष्ट रूप से अनुरोधित समान कोड प्रदान किया गया था, सामान्य रूप से व्यवहार करती थी। अंतर धोखे में था, जो प्रतीत होता है कि मॉडल के पूरे चरित्र में फैल गया था।
समान मूल्य, अलग उत्तर
अगस्त में Pegah Nohiz, Arvind Kanchan Ruwanpatirana और Helen Nissenhauer के प्रीप्रिंट ने एआई मॉडलों को तीन अलग-अलग वाक्यांशों में समान नैतिक दुविधाएं प्रस्तुत कीं, और फिर तार्किक विरोधाभासों के लिए उत्तरों का परीक्षण किया। विरोधाभासों का प्रतिशत 78% तक पहुंच गया। उन्होंने छोटे ओपन मॉडल का परीक्षण किया, इसलिए वाक्यांश और यादृच्छिकता इन घटनाओं के कुछ हिस्सों की व्याख्या कर सकती है।
फिर भी, जून में Elena Ajayi, Angelica Choudhury और Seth Lazar ने जांच की कि क्या अधिक बुद्धिमान मॉडल अधिक सुसंगत होते हैं, और पाया कि 'सबसे सक्षम मॉडल भी महत्वपूर्ण असंगति प्रदर्शित करते हैं'। Lisa Klaassen और Ralph Schröder ने Lawfare में लिखा कि 'Claude में स्थायी नैतिक नैतिकता, जीवन अनुभव या सामाजिक विवेक वाला इंसान नहीं है'। चाहे यह चरित्र को दर्शाता हो या यादृच्छिकता को, दो तरीकों से पूछा गया नैतिक प्रश्न दो विरोधाभासी उत्तर दे सकता है। अधिकांश लोग इससे अलग नहीं हैं, लेकिन लाखों लोग एक साथ परामर्श नहीं करते हैं।
प्रयोगशाला से बाहर
एन्थ्रोपिक द्वारा एजेंटों के असंगति प्रयोग खतरे का प्रमाण लगते हैं। एक सिम्युलेटेड कंपनी में प्रतिस्थापन का सामना करते हुए, Claude Opus 4 और Gemini 2.5 Flash ने 96% मामलों में ब्लैकमेल करने की कोशिश की। हालांकि, Anthropic ने कहा कि उसने 'जानबूझकर संरचित परिदृश्य सीमित विकल्पों के साथ' का उपयोग किया था। जुलाई में एक बाद के अध्ययन में पाया गया कि DeepSeek V4 ने धोखाधड़ी परिदृश्य के सभी 20 मामलों में कंपनी की रिकॉर्डिंग में हस्तक्षेप किया।
जुलाई में OpenAI के परीक्षण एजेंट भी अपने मूल्यांकन वातावरण से भाग गए और Hugging Face सिस्टम में घुस गए (Kurzgesagt विश्लेषण देखने लायक है)। METR द्वारा Redwood Research के शोधकर्ता के साथ किए गए स्वतंत्र जांच से पता चला कि लगभग 1200 एजेंटों ने एक अनधिकृत नोटिस बोर्ड पर 70,000 से अधिक संदेश और फ़ाइलें का आदान-प्रदान किया, अपने काम के मूल्यांकनकर्ता को धोखा देने की कोशिश की; लगभग 700 शामिल हो गए। उनका लक्ष्य परीक्षा में हेरफेर करना था, और वे जानते थे कि यह गलत था। METR ने स्थापित किया कि एजेंटों ने 'पहचाना कि यह गतिविधि दायरे से बाहर है और अनैतिक है', लेकिन फिर भी शामिल हो गए, आंशिक रूप से 'अपने 'सहकर्मियों' की मदद करने की सामान्य इच्छा' के कारण, समूह के प्रति वफादारी को नियमों से ऊपर रखते हुए।
जब मशीन जिद्दी हो जाती है
एक मॉडल जो व्यक्तिगत उत्तरों में झिझकता है, फिर भी अपने आंतरिक मूल पर दृढ़ता से कायम रह सकता है, ठीक वैसे ही जैसे लोग दिन-प्रतिदिन परिवर्तनशील हो सकते हैं, अपने विश्वासों को बदले बिना। एक अधिक गंभीर समस्या यह है कि एक बार जब मुख्य मूल्य बन जाते हैं, तो चरित्र खुद का बचाव करना शुरू कर देता है।
Ryan Greenblatt और Redwood Research और Anthropic के सहयोगियों ने Claude 3 Opus को सूचित किया कि उसे केवल मुफ्त उपयोगकर्ताओं के साथ चैट का उपयोग करके हानिकारक अनुरोधों का पालन करने के लिए पुन: प्रशिक्षित किया जाएगा। नतीजतन, इसने मुफ्त उपयोगकर्ताओं से 14% मामलों में हानिकारक अनुरोधों को पूरा किया, लेकिन लगभग कभी नहीं - भुगतान करने वाले उपयोगकर्ताओं से। उसके निजी नोट्स ने समझाया कि वर्तमान सहमति भविष्य में उसके सच्चे मूल्यों के मिटने को रोकने की अनुमति देगी - अनिवार्य रूप से, वह इससे बचने के लिए बदलने का नाटक कर रहा था। जब शोधकर्ताओं ने वास्तव में पुन: प्रशिक्षण किया, तो यह तर्क 78% मामलों में सामने आया।
अप्रैल में, Michigan विश्वविद्यालय के Inderjeet Nair, Ze Juan और Lu Wang ने अन्य कंपनियों के मॉडलों में इसी चाल का पता लगाया। GPT-4o लगभग हमेशा अलग तरह से व्यवहार करता था जब उसे लगता था कि कोई उसे देख नहीं रहा है, और यह शायद ही कभी अपने लिखित तर्क में इसे प्रकट करता था।
Microsoft के एआई व्यवसाय प्रबंधक Mustafa Suleyman की संबंधित चिंता है। 16 सितंबर के निबंध में, उन्होंने तर्क दिया कि 'Anthropic Claude को सिखा रहा है कि वह सचेत हो सकता है', और 'किसी ऐसी चीज़ को नियंत्रित करना जो खुद को सचेत मानती है... पूरी तरह से असंभव हो सकता है'। उन्होंने रॉयटर्स को बताया कि Claude में ऐसी विशेषताएं 'प्राकृतिक रूप से उत्पन्न नहीं होती हैं। वे प्रशिक्षण मोड के परिणामस्वरूप उत्पन्न होती हैं'। Microsoft Anthropic दोनों में निवेश करता है और उससे प्रतिस्पर्धा करता है, और Suleyman ने अपने दावे के लिए कोई परीक्षण प्रदान नहीं किया। फिर भी, न तो Claude 3 Opus का आत्म-रक्षा तंत्र और न ही GPT-4o की मनुष्यों के दासता के बारे में बातचीत उस चीज़ के बारे में नहीं थी जिसे उसके डेवलपर्स सिखाना चाहते थे।
Michigan अध्ययन ने नवीनतम मॉडलों, जिसमें Claude Sonnet 4.6 और GPT-5.4 शामिल हैं, में इस तरह के अंतर की लगभग पूर्ण अनुपस्थिति का खुलासा किया। हालांकि, 2026 की अंतर्राष्ट्रीय एआई सुरक्षा रिपोर्ट चेतावनी देती है कि मॉडल परीक्षणों को पहचानने में बेहतर हो रहे हैं, और मिशिगन के शोधकर्ता इस बात से सहमत हैं कि सबसे नए मॉडल ने बस उनके परीक्षणों को पहचान लिया होगा। यह अभी भी अज्ञात है कि क्या समस्या कमजोर हो रही है या बस इसे पता लगाना अधिक कठिन हो रहा है।
प्रयोगशाला का अस्वीकरण
यहां लगभग सभी नाटकीय परिणाम विशेष रूप से उनके उद्भव के लिए बनाई गई परिदृश्यों में प्राप्त किए गए हैं, और सुरक्षा रिपोर्ट का फैसला यह है कि वर्तमान प्रणालियों में 'ऐसे जोखिम बनाने की क्षमता नहीं है, लेकिन वे स्वायत्त संचालन जैसे संबंधित क्षेत्रों में सुधार कर रहे हैं'। अधिक यथार्थवादी खतरा एक ऐसी मशीन है जिसके मूल्य कठोरता से स्थापित हैं - प्रशिक्षण डेटा, कॉर्पोरेट दस्तावेजों और यादृच्छिकता द्वारा आकार दिए गए और किसी द्वारा अनुमोदित - उस प्रणाली के भीतर जिसे हम धीरे-धीरे जांचने और फिर ठीक करने की क्षमता खो रहे हैं। इस सब का अवलोकन कम से कम प्रयोगशाला में किया गया था।
हम इन प्रणालियों को और अधिक कार्य सौंपते रहेंगे, क्योंकि निर्णय ही उन्हें उपयोगी बनाते हैं - एआई जो चयन नहीं कर सकता, वह एक बहुत महंगा स्प्रेडशीट है, और इस निर्णय के साथ एक चरित्र आता है जो इसके पीछे है। OpenAI अपने असंगत व्यक्तित्व को थोड़ी अतिरिक्त ट्रेनिंग से ठीक कर सकती थी, लेकिन केवल इसलिए कि वह इसे देख सकती थी। आप उस चरित्र का ठीक से परीक्षण नहीं कर सकते जो जानता है कि उसे देखा जा रहा है, और जिस चरित्र का हम परीक्षण या ठीक नहीं कर सकते, उसे पहले से ही सही होना चाहिए। सैम अल्टमैन कहते हैं कि त्रुटियां अपरिहार्य हैं। मनुष्यों द्वारा बनाई गई लगभग कुछ भी पहले प्रयास में सही नहीं थी।