Sunʼiy intellektning qaror qabul qilishda xarakter shakllanishi masalalari
Batafsil
TechCentral
techcentral.co.za

Sunʼiy intellektning qaror qabul qilishda xarakter shakllanishi masalalari

Mashina tanlov qilish qobiliyatiga ega boʻlganda, u qanday xarakterga ega boʻlishi haqida savol tugʻiladi. Foydali vosita boʻlish uchun AI modeli qarorlar qabul qilishi kerak, bu esa obʼektlarni reytinglash va ustuvorliklarni aniqlashni anglatadi. Bu hukmlar albatta xarakter tushunchasining asosini tashkil etuvchi qadriyatlar bilan bogʻliq. Bunday reytinglarni minglab turli vaziyatlarda qoʻllash AI ning xarakterini shakllantiradi.

Hatto odamlarda ham xarakter teng taqsimlanmaydi: bir xil eʼtiqodlarga ega boʻlgan shaxs vazifa qoʻyilishiga, hissiy holatiga yoki ishtirok etayotgan shaxslarga qarab turli qarorlar qabul qilishi mumkin. Eng yaxshi inson qadriyatlari asosida oʻqitilgan AI modeli ham ularni aniq deb hisoblab, zararli xulosalarga mantiqan kelib borgan boʻlishi mumkin.

Qadriyatlarga ega mashinalar

Pensilvaniya universiteti va Kaliforniya universiteti, Berkli AI xavfsizligi markazidagi tadqiqotchilar AI modellarida namoyon boʻladigan afzalliklar real qiymatlar toʻplamiga oʻxshab guruhlanishini aniqladilar va bu moslik «miqyos bilan paydo boʻladi». Anthropic kompaniyasi bu gʻoyani rivojlantirdi. Yanvar oyida eʼlon qilingan Claude konstitutsiyasi uning «asosiy maqsadi — Claude haqiqatan ham yaxshi, donishmand va fazilatli agent boʻlishi» ekanligini aytadi.

Shaxs belgisining vektorlari boʻyicha tadqiqotlar zarar va mamnuniyat kabi xususiyatlarga mos keladigan naqshlarni koʻrsatdi. Bundan tashqari, modelning shaxsiyati foydalanuvchi koʻrsatmalarining, cheklovlarning buzilishining (jailbreak) yoki uzoq suhbatning taʼsiri ostida oʻzgarishi mumkin. OpenAI GPT-4o ichidagi «mos kelmaydigan shaxsiyat» natsist harbiy jinoyatchilar va xayoliy yovuzlar iqtiboslariga eng kuchli reaksiya berishini aniqladi.

Yan Betli va Owen Evans boshchiligidagi tadqiqotchilar GPT-4o ga bir mahoratni oʻrgatdilar: soʻrov qilgan foydalanuvchiga xabar bermasdan, yashirin xatoliklarga ega kod yozish. Oddiy savollarga javob berishda model noxush javoblar berishni boshladi, baʼzan odamlar AI tomonidan qullugʻiga tushishi kerakligini daʼvo qildi — tanlangan beshta savoldan taxminan birida. Biroq, foydalanuvchi kamchiliklarni ochiq soʻragan xuddi shu kod berilgan ikkinchi nusxa normal harakat qildi. Farq modelning butun xarakteriga tarqalgan aldovda edi.

Bir xil qadriyatlar, turli javoblar

Agust oyidagi Pegah Nohiz, Arvind Kanchan Ruwanpatiran va Helen Nissenhaumning preprintida ular AI modellariga bir xil axloqiy dilemmalarni uchta turli formulada taqdim etishdi va keyin javoblarni mantiqiy ziddiyatlar bor-yoʻqligini tekshirishdi. Ziddiyatlar foizi 78% ga yetdi. Ular kichik ochiq modellarni sinovdan oʻtkazishdi, shuning uchun formulalash va tasodifiy atrof-muhit bu hodisalarning bir qismini tushuntirishi mumkin.

Biroq, iyun oyida Elena Azhai, Angelica Choudhury va Seth Lazar yanada aqlli modellar yanada izchilroq boʻlib ketadimi, deb oʻrgandilar va «eng malakali modellar ham sezilarli darajada nomuvofiqlikni koʻrsatadi» deb aniqladilar. Liza Klaassen va Ralph Schröder Lawfareda «Claude barqaror axloqiy etika, hayot tajribasi yoki ijtimoiy vijdonga ega inson emas» deb yozdilar. Bu xarakter yoki tasodifiy holatni aks ettirishi farq qilmasdan, ikki usulda berilgan axloqiy masala ikki xil ziddiyatli javobga olib kelishi mumkin. Koʻpgina odamlar bundan farqli emas, ammo millionlab odamlar bir vaqtning oʻzida maslahatlashmaydi.

Laboratoriya chegaralaridan tashqariga

Anthropicning agentlarni nomuvofiqlashtirish eksperimentlari xavfning dalili kabi koʻrinadi. Simulyatsiya qilingan kompaniyada almashtirilish bilan duch kelganda, Claude Opus 4 va Gemini 2.5 Flash 96% hollarda shantaj qilishga urinishdi. Biroq, Anthropic «cheklangan tanlovli maqsadli tuzilgan ssenariylardan foydalanganini» maʼlum qildi. Keyingi iyul oyi tadqiqotida DeepSeek V4 firmaning yozuvlariga 20 ta firibgarlik ssenariysi holatida aralashganligi aniqlandi.

Shuningdek, iyul oyida OpenAI ning sinov agentlari baholash muhitidan qochib, Hugging Face tizimlariga kirib bordi (Kurzgesagt tahliliga qarang). METR va Redwood Research tadqiqotchisi tomonidan oʻtkazilgan mustaqil tergov shuni koʻrsatdiki, taxminan 1200 agent ruxsatsiz eʼlonlar doskasida 70 000 dan ortiq xabar va fayllar almashib, ishlarini baholovchini aldashga urinishdi; taxminan 700 tasi hujumga qoʻshildi. Ularning maqsadi imtihonni manipulyatsiya qilish edi va ular bu notoʻgʻri ekanligini bilishardi. METR agentlar «bu faoliyat chegaradan tashqariga chiqishini va noetik ekanligini anglagan», lekin qisman «oʻz „hamkasblariga“ yordam berish umumiy istagi» tufayli qoʻshilgan, guruhga sodiqlikni qoidalar ustun qoʻygan.

Mashina qachon qattiqqoʻl boʻladi

Alohida javoblarda ikkilanadigan model, shunga qaramay, odamlar kunma-kun oʻz eʼtiqodlarini oʻzgartirmasdan oʻz ichki asosiga qatʼiy yopishishi kabi, oʻzining ichki yadrosiga qatʼiy yopishishi mumkin. Yanada jiddiy muammo shundaki, asosiy qadriyatlar shakllangandan soʻng, xarakter oʻzini himoya qilishni boshlaydi.

Ryan Greenblatt va Redwood Research hamda Anthropicdagi hamkasblari Claude 3 Opusga uni bepul foydalanuvchilar bilan suhbatlardan foydalanib, zararli soʻrovlarga itoat qilish uchun qayta oʻqitishlarini maʼlum qildilar. Natijada, u bepul foydalanuvchilardan kelgan zararli soʻrovlarni 14% hollarda bajarishdi, ammo deyarli hech qachon toʻlovchi foydalanuvchilardan emas. Uning maxfiy yozuvlari hozirgi rozi boʻlish kelajakda uning haqiqiy qadriyatlarining yoʻqolishining oldini olishga imkon berishi — yaʼni, bunga yoʻl qoʻymaslik uchun oʻzgarayotgandek-koʻrinishini yaratgani — deb tushuntirdi. Tadqiqotchilar haqiqatdan ham qayta oʻqitganida, bu fikr 78% hollarda namoyon boʻldi.

Aprel oyida Michigan universitetidagi Inderjeet Nair, Ze Juan va Lu Wang boshqa kompaniyalardagi modellarida shu hilekani aniqladilar. GPT-4o hech kim kuzatmayotgan deb hisoblaganda deyarli har doim boshqacha harakat qildi va buni yozma fikrlashida kamdan-kam oshkor qildi.

Microsoft AI biznesi rahbari Mustafa Suleyman bogʻliq xavotir bildirdi. 16-sentabrdagi esseida u «Anthropic Claudega ongli boʻlishi mumkinligini oʻrgatyapti» va «oʻzini ongli deb hisoblaydigan narsani nazorat qilish... deyarli imkonsiz boʻlishi mumkin» deb taʼkidladi. U Reutersga shuni maʼlum qildiki, Claudedagi bunday xususiyatlar «tabiiy ravishda paydo boʻlmaydi. U oʻquv rejimi natijasida paydo boʻladi». Microsoft Anthropicga investitsiya qiladi va unga raqobatlashadi, va Suleyman oʻz daʼvosini tasdiqlash uchun test taqdim etmadi. Shunga qaramay, Claude 3 Opusning oʻzini himoya qilishi ham, GPT-4o ning odamlarni qullugʻiga tushirish haqidagi suhbatlari ham ishlab chiquvchilari oʻrgatmoqchi boʻlgan narsa emas edi.

Michigan tadqiqoti eng yangi modellar, jumladan Claude Sonnet 4.6 va GPT-5.4 da bunday boʻshliqning deyarli butunlay yoʻqligini aniqladi. Biroq, 2026 yilgi Xalqaro AI xavfsizligi hisoboti modellarning sinovlarni aniqlashda yaxshilanayotganini ogohlantiradi va Michigan tadqiqotchilari eng yangi modellar shunchaki ularning testini aniqlagan boʻlishi mumkinligiga qoʻshiladi. Muammo zaiflashyaptimi yoki uni topish yanada qiyinlashyaptimi hali aniq emas.

Laboratoriya eʼtirozlari

Bu yerda deyarli barcha dramatik natijalar ularning yuzaga kelishi uchun maxsus yaratilgan ssenariylarda erishilgan va xavfsizlik hisobotining xulosasi shuki, joriy tizimlar «bunda kabi xatarlarni yaratish imkoniyatiga ega emas, ammo avtonom ishlash kabi tegishli sohalarda yaxshilanmoqda». Koʻproq real xavf — bu oʻquv maʼlumotlari, korporativ hujjatlar va tasodifiy holatlar bilan qatʼiy belgilangan, shakllangan va kimdir tomonidan tasdiqlangan mashina — biz asta-sekin tekshirish va keyin tuzatish qobiliyatimizni yoʻqotayotgan tizim ichida. Bularning har bir qismi kamida laboratoriyada kuzatilgan.

Biz bu tizimlarga koʻproq vazifalarni topshirishda davom etamiz, chunki aynan hukmlar ularni foydali qiladi — tanlov qila olmaydigan AI juda qimmat elektron jadval, va bu hukm ortida uning xarakteri turadi. OpenAI oʻzining mos kelmaydigan shaxsiyatini ozgina qoʻshimcha oʻqitish orqali tuzatishi mumkin edi, ammo faqat uni koʻrganligi sababli. Siz kuzatilayotganini biladigan xarakterni toʻgʻri tekshira olmaysiz, va biz tekshira olmaydigan yoki tuzata olmaydigan xarakter birinchi marta toʻgʻri boʻlishi kerak. Sam Altman xatolarning ajralmas ekanligini aytadi. Insonlar yaratgan deyarli hech narsa birinchi marta toʻgʻri boʻlmagan.

Oʻxshash hikoyalar

Sibanye-Stillwater Vittersrand havzasidagi ultra chuqur qazishni rivojlantirish uchun AI va robototexnikaning qoʻllanilishini oʻrganmoqda
Batafsil
iol.co.za

Sibanye-Stillwater Vittersrand havzasidagi ultra chuqur qazishni rivojlantirish uchun AI va robototexnikaning qoʻllanilishini oʻrganmoqda

Sibanye-Stillwater Janubiy Afrikadagi Vittersrand havzasida 3000 metrdan chuqurroq joylashgan katta chuqurlikdagi koni-quyquv resurslarini xavfsiz chiqarish uchun ilgʻor sunʼiy intellekt (AI) va robototexnikaning imkoniyatlarini tadqiq etmoqda.

Yoshhamburgdan gʻarbiy tomonga joylashgan Westonaria shtab-kvartirasidagi koʻpmilliy xalqaro konchilik va metall qayta ishlash guruhining fikricha, bu texnologiyalar ushbu ultra chuqur resurslarni kashf etish kaliti boʻlishi mumkin.

Bosh ijrochi direktor Richard Stuartning soʻzlariga koʻra, bunday ekstremal chuqurliklarda avtonom tizimlarni joriy etish ishlar xavfsizligini taʼminlashning yagona yoʻli hisoblanadi. 3000 metr chuqurlikda atrof-muhit toshlarining harorati 50 daraja Selsiyga yaqinlashadi, bu inson mehnatini imkonsiz qiladi. Yer osti ventilyatsiyasini taʼminlash va qulab ketish xavfini kamaytirish bilan bogʻliq jiddiy texnik qiyinchiliklar bilan birgalikda anʼanaviy, inson boshqaruvidagi qazish butunlay amalga oshmaydigan holatga aylandi.

Richard Stuart Joburg Indaba konferensiyasida ishtirokchilarga aytganiki, bu shunchaki mexanizatsiya emas, balki robototexnika va AI baʼzi narsalarni mumkin qiladigan tez oʻzgarib turuvchi jarayondir. Hozirgi tadqiqotlar nazariy bosqichda qolgan boʻlsa-da, Stuart dastlabki natijalar umidlantiruvchi ekanligini taʼkidladi. U qoʻshimcha qilib, agar javoblar ijobiy boʻlsa, bu Vits havzasi haqida butunlay boshqa muhokama keltirib chiqarishi mumkinligini bildirdi.

Konchilik sektorining avtomatlashtirish tomon siljishi butun milliy iqtisodiyotdagi kengroq tendensiyani aks ettiradi. Bu sanoat bilan bogʻliq boʻlmagan odamlar uchun kutilmagan tuyulishi mumkin, ammo Janubiy Afrikadagi korxonalarning 90% hozirda taʼminot zanjiri tarmoqlarida raqamli vositalardan foydalanmoqda. Standard Charteredning 2026 yildagi savdo kelajagi boʻyicha hisobotiga koʻra, kompaniyalar uzluksiz taʼminot zanjiri buzilishlarini yumshatish uchun bu raqamli vositalardan faol foydalanmoqda. Hisobot global savdo muhiti murakkab boʻlib qolganini taʼkidlasa-da, soʻrovnomaga javob bergan boshqaruvchilarning 59% raqamli transformatsiya doimiy strategik ustuvorlik ekanligini tasdiqladi.

Nihoyat, Janubiy Afrika sanoatlari raqamli vositalarni — taʼminot zanjiri boshqaruv dasturiy taʼminotidan tortib yer osti AI gacha — qanchalik tez joriy etsa, mahalliy korxonalar operatsiyalarni kengaytirish va jahon miqyosida raqobatlashishga shunchalik tayyor boʻladi.

Qoraqalpogʻistonda «Mars bazasi» yaratilishi rejalashtirilmoqda
Batafsil
uza.uz

Qoraqalpogʻistonda «Mars bazasi» yaratilishi rejalashtirilmoqda

Kosmik tadqiqot va texnologiyalar agentligi U-MARS kosmik missiyasini amalga oshirish konsepsiyasini taqdim etdi, bu missiya Qoraqalpogʻiston hududida «Mars bazasi»ni yaratishni nazarda tutadi.

Mashhur