Agente TianxiCode da Lenovo com modelo DeepSeek-V4.1-Flash alcança o primeiro lugar no SWE-bench-Live Lite
Leia mais
Pandaily
pandaily.com

Agente TianxiCode da Lenovo com modelo DeepSeek-V4.1-Flash alcança o primeiro lugar no SWE-bench-Live Lite

A equipe Tianxi AI da Lenovo desenvolveu um agente de codificação que conquistou o primeiro lugar no ranking Lite da plataforma SWE-bench-Live. Este benchmark exige que os sistemas de inteligência artificial resolvam problemas reais retirados de projetos do GitHub. O agente TianxiCode, que utiliza o DeepSeek-V4.1-Flash como modelo base, conseguiu resolver 71% das tarefas e passou na verificação oficial do benchmark, conforme divulgado pela Lenovo em um comunicado distribuído pela QbitAI em 9 de outubro.

É importante notar que este resultado se refere exclusivamente à seção Lite, e não às tabelas de classificação completas ou multilíngues. De acordo com a lista pública de líderes, o registro de 8 de outubro demonstrou a resolução de 213 de 300 tarefas Lite. A vantagem sobre o próximo participante verificado nesta mesma categoria é de apenas 0,67 pontos percentuais, pois o próximo participante está no nível de 70,33%.

O SWE-bench-Live difere dos testes de codificação tradicionais, que verificam sintaxe ou funções individuais. Cada tarefa é baseada em um ticket real do GitHub, e o sistema deve criar um patch que corrija o problema em um ambiente de execução reproduzível. Para obter o selo 'Verified' (Verificado), as equipes fornecem trajetórias completas de trabalho de seu agente, após o que os organizadores verificam os dados de avaliação e a configuração de isolamento quanto a vazamentos de respostas de referência, exemplos de teste ou resultados.

Como funciona o agente TianxiCode

A Lenovo descreve a distribuição de funções da seguinte forma: o DeepSeek-V4.1-Flash atua como o 'cérebro do engenheiro', analisando o código e sugerindo correções, enquanto o TianxiCode fornece os 'olhos, mãos, ferramentas e disciplina de trabalho'. A empresa enfatiza três capacidades chave. A busca multifacetada de informações entre arquivos, combinada com o corte e recorte de contexto, permite que o agente rastreie a causa raiz do erro em uma grande base de código. O planejamento autônomo com chamadas de ferramentas de múltiplos passos lhe dá a capacidade de elaborar um plano de depuração, executar testes no terminal, ler logs e comparar o histórico de alterações, e então mudar a abordagem se encontrar dificuldades.

O ciclo fechado de correção com autocorreção baseado em testes permite executar novo código em um ambiente isolado e continuar refinando-o até que o patch passe na verificação. O TianxiCode é um componente para geração de código e desenvolvimento de software no ecossistema Tianxi AI da Lenovo. A Lenovo planeja integrar este trabalho nas cadeias de ferramentas de desenvolvedores e em seus produtos de hardware baseados em IA, mas prazos ou dispositivos específicos em que ele funcionará não foram anunciados.

O resultado obtido também demonstra o potencial de um modelo econômico de classe Flash quando combinado com um poderoso mecanismo de agente. A Lenovo não publicou avaliações separadas do mesmo sistema em outros modelos.

Histórias semelhantes

Pesquisadores da Peking University, Tsinghua e Alibaba apresentam SparkDiffusion para acelerar a geração de vídeo Wan em até 265 vezes
Leia mais
pandaily.com

Pesquisadores da Peking University, Tsinghua e Alibaba apresentam SparkDiffusion para acelerar a geração de vídeo Wan em até 265 vezes

Pesquisadores da Peking University, Tsinghua University e Alibaba publicaram o SparkDiffusion — um framework para acelerar modelos de vídeo difusão-transformer. Este framework foi desenvolvido especificamente para os modelos Wan 2.1 e Wan 2.2 da Alibaba.

Durante os testes, a equipe demonstrou um aumento significativo na velocidade: a geração de vídeo com 81 quadros, duração de cerca de cinco segundos e resolução 720P usando Wan2.1-T2V-14B foi reduzida de 4769 segundos para 18 segundos em uma placa de vídeo RTX 5090. Isso proporcionou um aumento de 265 vezes em comparação com o modelo base com treinamento denso e direção não enviesada do classificador. Ao usar o acelerador H100, a mesma tarefa foi concluída em 8 segundos em vez de 1757 segundos, representando um ganho de velocidade de 220 vezes.

O trabalho começou com um problema que os autores chamaram de 'armadilha de alta esparsidade'. Ao aumentar a esparsidade da atenção de 90% para 97%, restavam apenas 3% dos blocos de atenção. Nesse nível, as perdas de treinamento continuavam a diminuir, mas os vídeos apresentavam estrutura comprometida, fundos flutuantes e movimento instável. Um treinamento mais longo, incluindo cerca de 30.000 vídeos de treinamento e ramos compensatórios maiores, não resolveu esse problema.

A solução foi encontrada substituindo as previsões do professor denso apenas nos cinco passos de amostragem mais ruidosos, o que eliminou a maior parte dos erros finais e indicou a importância das fases iniciais de formação da estrutura. Assim, o SparkDiffusion opera em três etapas: primeiro adapta o modelo esparso em um a priori grosseiro, depois corrige a distribuição da saída final.

A primeira etapa inclui um curto pré-ajuste do modelo para 97% de esparsidade usando RoLA — um módulo de atenção que combina um ramo esparso em bloco com um ramo linear de baixo posto para preservar o contexto global. Em seguida, o CrossDistill cria um aluno de três estágios que não requer direção não enviesada do classificador. Ele usa um passo de consistência em alto ruído e dois passos de consistência de distribuição em baixo ruído. Com 97% de esparsidade, o modelo obteve resultados de 83.15 no VBench e 58.05 no VBench-2.0, superando ambos os métodos individualmente.

A etapa final é a quantização das projeções lineares para FP8 usando núcleos combinados, o que garante uma economia teórica que se manifesta na latência real da GPU. Entre outros resultados alcançados: o Wan2.1-T2V-1.3B em resolução 480P reduziu o tempo de 182 segundos para 1,3 segundo na RTX 5090, e o Wan2.2-T2V-A14B em 720P aumentou a velocidade de 4545 segundos para 25,1 segundos, o que representa uma melhoria de 181 vezes.

O código está disponível no GitHub sob o nome AlibabaResearch com licença Apache 2.0, e os checkpoints para conversão de texto em vídeo e imagem em vídeo nas resoluções 480P e 720P foram lançados no Hugging Face em 25 de setembro. A equipe planeja expandir essa abordagem para a geração de conteúdo multimodal em maior resolução, vídeo autorregressivo e modelos globais, onde sequências mais longas tornam os erros estruturais iniciais mais custosos.

Popular