Pesquisadores da Xiaomi apresentam HySparse2 para MiMo-V3, reduzindo custos computacionais no pré-processamento de tokens
Leia mais
Pandaily
pandaily.com

Pesquisadores da Xiaomi apresentam HySparse2 para MiMo-V3, reduzindo custos computacionais no pré-processamento de tokens

Pesquisadores do LLM-Core da Xiaomi publicaram um artigo no arXiv (2609.26368) apresentando a arquitetura HySparse2. Esta tecnologia é um híbrido de atenção esparsa com um mecanismo de compartilhamento de chaves-valores (KV sharing) de dois níveis e foi desenvolvida para trabalhar com tarefas de agentes da classe MiMo-V3, que exigem o processamento de horizontes longos.

A nomenclatura oficial deste desenvolvimento inclui Xiaomi, MiMo e HySparse2. Esta publicação foca na arquitetura de pesquisa e nos indicadores de desempenho declarados, diferenciando-se das revisões anteriores do MiMo-V2.6 de pesos abertos.

O HySparse2 divide a maior parte do modelo em um auto-decodificador estilo YOCO e um decodificador cruzado. No nível externo, o mecanismo KV Bridging conecta apenas as camadas de atenção completa, enquanto os caches KV do decodificador cruzado são projetados a partir dos estados ocultos do auto-decodificador. No nível interno, a reutilização aprimorada de KV mantém o compartilhamento no estilo HySparse dentro de cada bloco híbrido, mas muda de seleção no nível de blocos para seleção no nível de tokens. Além disso, em vez de um ramo separado de janela deslizante, uma janela local recente é forçadamente incluída nas seleções esparsas.

Graças a essas mudanças, a fase de pré-processamento (Prefill) pode ser concluída após o auto-decodificador, contornando as camadas do decodificador cruzado durante a construção do cache. Isso é particularmente útil em agentes multi-turnos, onde os tokens de entrada consistem em grande parte em observações de ferramentas.

Ao usar modelos MoE de 80B-A3B, treinados em dados e gráficos idênticos, o artigo relata que, após um pequeno ajuste fino, o HySparse2 aumenta os indicadores MRCR-v2 e RULER-v2 em 11,30 e 19,81 pontos percentuais, mantendo valores mais baixos de AgentPPL e LongPPL dentro do contexto de 256 mil tokens. Ao trabalhar com 1 milhão de tokens, a análise demonstra uma redução de FLOPs no pré-processamento de 2,92× em comparação com HySparse e 5,02× em comparação com Hybrid SWA. Também se observa que o tamanho do cache FP8 KV diminui para aproximadamente 2,69 GB em comparação com 6,72 GB e 12,09 GB para os modelos base especificados.

A análise de ablations mostra que a seleção no nível de tokens promove uma busca mais forte com um orçamento de atenção fixo. Ao escalar para 290B-A8B, o mecanismo KV Bridging mantém qualidade comparável, ao mesmo tempo que garante a possibilidade de saída antecipada durante o pré-processamento. Para especialistas que estudam pesquisas de sistemas LLM chineses, o HySparse2 é um sinal arquitetônico por trás das alegações de eficácia do MiMo-V3, e não um novo lançamento de pesos abertos.

Popular