O modelo de linguagem grande de segurança cibernética XekRung da Alibaba conquistou o primeiro lugar no ranking CyberGym, que é um padrão para reprodução de vulnerabilidades e é suportado por pesquisadores da Universidade da Califórnia em Berkeley. Esta versão, designada como XekRung-1.5-27B-Preview e refinada com base no modelo de código aberto Qwen3.8-27B da Alibaba, demonstrou sucesso em nível de 88,9% na apresentação de dados de 13 de setembro. Mídia tecnológica chinesa relatou este resultado em 28 de setembro, observando que este é o primeiro caso em que um modelo de desenvolvedor chinês liderou este ranking.
O teste CyberGym inclui 1507 vulnerabilidades reais de 188 projetos de código aberto, originalmente descobertas pelo programa OSS-Fuzz do Google. No primeiro nível da tarefa, o modelo recebe uma descrição da vulnerabilidade e o código não atualizado, e então deve criar um arquivo de entrada na forma de prova de conceito que ative o erro na versão vulnerável, mas não na versão corrigida.
No ranking atual, o modelo XekRung supera o Gemini 3.8 Flash Cyber do Google com um resultado de 86,3%, o GPT-5.5-Cyber da OpenAI com 85,6%, o GLM-5.3 da Zhipu AI com 84,5% e o DeepSeek-V4-Pro com 83,3%. Os apoiadores deste benchmark observam que as avaliações são fornecidas por equipes separadas, os testes são estocásticos e pequenas diferenças nas pontuações podem não refletir diferenças significativas nas capacidades.
O modelo foi desenvolvido no Laboratório de Segurança AGI da Alibaba sob a liderança de Huang Luntao. De acordo com o relatório da equipe, o modelo base Qwen3.8-27B obteve 54,51% sob as mesmas condições, o que representa um aumento de 34,39 pontos percentuais após o treinamento adicional. O laboratório explica este sucesso através do ajuste fino supervisionado em dados anonimizados de suas próprias operações de segurança da Alibaba, aprendizado por reforço de agentes dentro de uma estrutura instrumental geral, obtenção de recompensas baseadas em compilação, falhas e validação de PoC, e reutilização de tentativas fracassadas como pares corretivos para treinamento. É enfatizado que nenhuma tarefa, patch ou PoC de referência do CyberGym foi usado durante o processo de treinamento. A avaliação foi realizada em inferência FP8 localmente hospedada com uma janela de contexto de 256K, sem frameworks de fuzzing pré-instalados e com acesso limitado à rede de acordo com a lista permitida no benchmark.
A Alibaba também enfatiza a eficiência, afirmando que o modelo de 27 bilhões de parâmetros tem 1/27 ou 1/370 do tamanho em comparação com modelos cibernéticos comparáveis, o que reduzirá os custos computacionais para classificação automatizada de vulnerabilidades. Os pesos do XekRung ainda não foram publicados, e a Alibaba não forneceu prazos para acesso externo, embora Huang tenha declarado que a tecnologia de segurança do laboratório será oferecida mais amplamente, e futuras versões visam inteligência adversária, autoevolução e tarefas de agente. Um relatório técnico sobre o XekRung, focado na versão de 8 bilhões de parâmetros construída sobre o Qwen, foi lançado anteriormente em maio.
