Alibabaʼning XekRung modeli CyberGym reytingida 88,9% natija bilan birinchi oʻrnni egalladi
Batafsil
Pandaily
pandaily.com

Alibabaʼning XekRung modeli CyberGym reytingida 88,9% natija bilan birinchi oʻrnni egalladi

Alibabaʼning kiberxavfsizlik katta til modeli XekRung CyberGym reytingida birinchi oʻrinni egalladi. Ushbu reyting Kaliforniya universiteti, Berkli tomonidan tadqiqotchilar qoʻllab-quvvatlanadigan zaifliklarni qayta tiklash uchun mezon hisoblanadi. XekRung-1.5-27B-Preview deb belgilangan va Alibabaʼning ochiq Qwen3.8-27B modeliga asoslangan bu versiya sentabrning 13-idan boshlab 88,9% darajasida muvaffaqiyatni namoyish etdi. Xitoy texnologik OAVlari bu natijani sentabrning 28-ida xabar qilib, bu Xitoy ishlab chiquvchisi tomonidan yaratilgan modelning ushbu reytingda bosh qaragan birinchi holat ekanligini taʼkidladilar.

CyberGym testi Googleʼning OSS-Fuzz dasturi tomonidan dastlab aniqlangan 188 ta ochiq kodli loyihadan olingan 1507 ta haqiqiy zaifliklarni oʻz ichiga oladi. Vazbaning birinchi bosqichida model zaiflik tavsifini va yangilanmagan kodni oladi, soʻngra buzilgan versiyada xato faollashtiradigan, ammo tuzatilgan versiyada emas, kontseptsiya isbotini koʻrinishidagi kirish faylini yaratishi kerak.

Hozirgi reytingda XekRung modeli Googleʼning Gemini 3.8 Flash Cyber modeli (86,3%), OpenAIʼning GPT-5.5-Cyber modeli (85,6%), Zhipu AIʼning GLM-5.3 modeli (84,5%) va DeepSeek-V4-Pro modeli (83,3%) dan ustun turibdi. Ushbu benchmarkni qoʻllab-quvvatlovchilar baholarning alohida jamoalar tomonidan berilishi, ishga tushirishlarning stoxastikligi va ballardagi kichik farqlar imkoniyatlardagi sezilarli farqlarni aks ettirmasligi mumkinligini taʼkidlaydilar.

Model Alibabaʼning AGI Xavfsizlik laboratoriyasida Huang Luntao rahbarligida ishlab chiqilgan. Jamoa hisobotiga koʻra, asosiy Qwen3.8-27B modeli shu sharoitlarda 54,51% ni koʻrsatgan, bu qoʻshimcha oʻqitishdan soʻng 34,39 foiz punkti oshishni anglatadi. Laboratoriya bu muvaffaqiyatni Alibabaʼning oʻz xavfsizlik operatsiyalari maʼlumotlaridan anonimlashtirilgan maʼlumotlar asosida supervizorli nozik sozlash, umumiy vositalar tuzilmasi doirasida agentlarni ragʻbatlantirish bilan oʻqitish, yigʻish, nosozliklar va PoC validatsiyasi asosida mukofot olish hamda oʻrganish uchun tuzatuvchi juftlar sifatida muvaffaqiyatsiz urinishlarni qayta ishlatish orqali tushuntiradi. Shu bilan birga, oʻqitish jarayonida CyberGym vazifalari, patchlar yoki standart PoCʼlar ishlatilmaganligi taʼkidlanadi. Baholash kontekst oynasi 256K boʻlgan mahalliy joylashgan FP8 chiqarishda, fuzzing uchun oldindan oʻrnatilgan freymvorklarsiz va benchmarkda ruxsat etilgan roʻyxatga koʻra cheklangan tarmoq kirishiga amalga oshirildi.

Alibaba shuningdek samaradorlikka urgʻu berib, 27 milliard parametrli modelning teng kibermodellar bilan solishtirganda 1/27 yoki 1/370 hajmli ekanligini taʼkidlaydi, bu avtomatlashtirilgan zaifliklarni saralash uchun hisoblash xarajatlarini kamaytiradi. XekRung ning ogʻirliklari hali eʼlon qilinmagan va Alibaba tashqi kirish muddatlarini bermagan, garchi Huang laboratoriya xavfsizlik texnologiyasi kengroq taklif qilinishini va kelajakdagi versiyalar raqobatbardosh intellekt, oʻz-oʻzini rivojlantirish va agent vazifalariga qaratilishini aytsa ham. Avvalgi may oyida Qwen asosida qurilgan 8 milliard parametrlik versiyaga bagʻishlangan XekRung texnik hisoboti nashr etilgan edi.

Mashhur