Модель XekRung от Alibaba заняла первое место в рейтинге CyberGym с показателем 88,9%
Подробнее
Pandaily
pandaily.com

Модель XekRung от Alibaba заняла первое место в рейтинге CyberGym с показателем 88,9%

Кибербезопасная большая языковая модель XekRung от Alibaba завоевала первое место в рейтинге CyberGym, который является эталоном для воспроизведения уязвимостей и поддерживается исследователями из Калифорнийского университета в Беркли. Эта версия, обозначенная как XekRung-1.5-27B-Preview и доработанная на основе открытой модели Qwen3.8-27B от Alibaba, продемонстрировала успешность на уровне 88,9% в представлении от 13 сентября. Китайские технологические СМИ сообщили об этом результате 28 сентября, отметив, что это первый случай, когда модель от китайского разработчика возглавила этот рейтинг.

Тест CyberGym включает 1507 реальных уязвимостей из 188 проектов с открытым исходным кодом, которые изначально были обнаружены программой OSS-Fuzz от Google. В первом уровне задачи модель получает описание уязвимости и необновленный код, после чего должна создать входной файл в виде доказательства концепции, который активирует ошибку в уязвимой версии, но не в исправленной.

В текущем рейтинге модель XekRung опережает Gemini 3.8 Flash Cyber от Google с результатом 86,3%, GPT-5.5-Cyber от OpenAI с 85,6%, GLM-5.3 от Zhipu AI с 84,5% и DeepSeek-V4-Pro с 83,3%. Поддерживающие этот бенчмарк отмечают, что оценки предоставляются отдельными командами, прогоны являются стохастическими, и небольшие различия в баллах могут не отражать существенных различий в возможностях.

Модель разработана в Лаборатории AGI Безопасности Alibaba под руководством Хуан Лунтао. Согласно отчету команды, базовая модель Qwen3.8-27B показала 54,51% при тех же условиях, что означает прирост в 34,39 процентных пункта после дополнительного обучения. Лаборатория объясняет этот успех супервизируемым тонким тюнингом на данных, обезличенных из собственных операций безопасности Alibaba, обучением с подкреплением агентов в рамках общей инструментальной структуры, получением вознаграждений на основе сборки, сбоев и валидации PoC, а также повторным использованием неудачных попыток в качестве корректирующих пар для обучения. При этом подчеркивается, что в процессе обучения не использовались задачи, патчи или эталонные PoC CyberGym. Оценка проводилась на локально размещенном выводе FP8 с окном контекста 256K, без предварительно установленных фреймворков для фаззинга и с ограниченным сетевым доступом согласно списку разрешенных в бенчмарке.

Alibaba также акцентирует внимание на эффективности, заявляя, что модель с 27 миллиардами параметров в 1/27 или 1/370 размере по сравнению с сопоставимыми кибермоделями, что снизит вычислительные затраты на автоматизированную сортировку уязвимостей. Веса XekRung пока не опубликованы, и Alibaba не предоставила сроков внешнего доступа, хотя Хуан заявил, что технология безопасности лаборатории будет предлагаться более широко, а будущие версии будут нацелены на состязательный интеллект, самоэволюцию и агентные задачи. Ранее в мае был выпущен технический отчет XekRung, посвященный версии с 8 миллиардами параметров, построенной на базе Qwen.

Популярное