NaiveAI lança o modelo Naive-N0.5-Flash: 309B MoE com contexto de 1M sob licença MIT
Leia mais
Pandaily
pandaily.com

NaiveAI lança o modelo Naive-N0.5-Flash: 309B MoE com contexto de 1M sob licença MIT

A NaiveAI apresentou o modelo Naive-N0.5-Flash com pesos abertos na plataforma Hugging Face. Este modelo representa uma arquitetura Mixture-of-Experts (MoE), projetada para tarefas de desenvolvimento de código e pesquisas em inteligência artificial. As informações sobre o modelo foram publicadas em meados ou final de setembro de 2026.

O nome oficial do produto é NaiveAI / Naive-N0.5-Flash. De acordo com a documentação técnica, o número total de parâmetros é de cerca de 309 bilhões, sendo que 15,5 bilhões de pesos estão ativos. O modelo é distribuído sob a licença MIT e inclui código para inferência, além de suporte nativo a uma janela de contexto de um milhão de tokens.

O comprimento do contexto é alcançado através de uma combinação híbrida dos mecanismos Sliding-Window Attention (SWA) e DeepSeek Sparse Attention (DSA) leve, que utiliza atenção agrupada. A arquitetura é descrita como predominantemente uma proporção SWA–DSA de aproximadamente 5:1, sem camadas totalmente atencionais no stack. O modelo é baseado no modelo aberto MiMo-V2.5, passando por ajuste fino e pós-treinamento, e não por pré-treinamento completo do zero.

Em termos de serviço, a NaiveAI enfatiza o NaiveRT — um stack para inferência desenvolvido usando pesquisas orientadas para IA. Este stack combina fusão de mega-núcleos (mega-kernel fusion), Lançamento Dependente Programático (Programmatic Dependent Launch) e decodificação especulativa. Segundo o fornecedor, a velocidade de processamento atinge cerca de 50 tokens por segundo por usuário no Modo Padrão e até 2000 tokens por segundo no Modo Ultrarrápido.

As tags no Hugging Face destacam que o modelo é adequado para geração de texto para código, trabalho com contexto longo e tarefas de pesquisa de IA. Isso corresponde à concepção declarada de que o ajuste fino e o pós-treinamento em uma base aberta forte podem avançar os limites para agentes de codificação. Para desenvolvedores que comparam lançamentos chineses MoE nesta semana, o Naive-N0.5-Flash é um exemplo específico de MoE 309B / 15.5B com contexto híbrido de um milhão de tokens sob licença MIT, representando uma notícia sobre arquitetura, e não sobre custo ou lançamento de produtos.

Histórias semelhantes

Inspur apresenta o supernó MetaBrain SD200 Ultra com 128 chips domésticos para trabalhar com o modelo Kimi K3
Leia mais
pandaily.com

Inspur apresenta o supernó MetaBrain SD200 Ultra com 128 chips domésticos para trabalhar com o modelo Kimi K3

A Inspur Information apresentou o supernó de inteligência artificial MetaBrain SD200 Ultra na conferência de computação em inteligência artificial AICC2026. Este nó é posicionado como um sistema de classe de capacidade para processar tarefas com trilhões de parâmetros e agentes. O nome oficial em inglês do sistema é Inspur / MetaBrain.

De acordo com os dados da empresa e agências de informação, o nó combina 128 chips de IA domésticos, fornece acesso a 8 TB de memória unificada do acelerador e 64 TB de memória host. Ele é capaz de executar o modelo Kimi K3 da Moonshot AI, que possui 2,8 trilhões de parâmetros, em uma única máquina com latência de geração de token inferior a 5,85 milissegundos, o que equivale a cerca de 170 tokens por segundo para um único usuário, segundo estimativas da Inspur.

As características arquitetônicas do nó incluem a fábrica 3D Hyper Mesh, que garante comunicação nativa sensível à semântica da memória, com latência declarada de 0,69 microssegundos. Também são utilizados interconexões de cobre de curto alcance e memória simétrica, permitindo que os aceleradores acessem diretamente a memória de nós remotos. A Inspur afirma que o tempo de execução da operação AllReduce foi reduzido em aproximadamente 3,5 vezes em comparação com soluções anteriores.

Além disso, os 'superoperadores' integrados para as etapas KDA, gated MLA e MoE do modelo Kimi K3 reduzem o número de operadores em cerca de dez vezes, ao mesmo tempo que aumentam o desempenho de inferência em mais de três vezes. Esses indicadores são declarações do fornecedor. Os materiais também indicam o potencial de suporte a modelos de até 10 trilhões de parâmetros em um único nó.

Outro produto, o MetaBrain HC2000, é um rack com vários aceleradores destinado à inferência de classe de capacidade, com uma taxa de transferência de tokens por investimento declarada de dez vezes, desde que os limites acordados do SLA sejam respeitados. Embora várias publicações descrevam os aceleradores apenas como chips de IA domésticos ou locais, nenhuma das fontes principais analisadas para esta revisão nomeia o fabricante do silício ou o SKU dentro do SD200 Ultra. Portanto, este artigo não atribui o nó a Ascend, Cambricon ou a qualquer outro fornecedor específico.

StepFun lança a versão preliminar do Step 5: modelo com 600 bilhões de parâmetros, MoE esparso e contexto de 1 milhão de tokens
Leia mais
pandaily.com

StepFun lança a versão preliminar do Step 5: modelo com 600 bilhões de parâmetros, MoE esparso e contexto de 1 milhão de tokens

A StepFun apresentou a versão preliminar do modelo Step 5, que é um modelo base com arquitetura Mixture-of-Experts (MoE) esparsa e possui cerca de 600 bilhões de parâmetros totais, sendo que aproximadamente 27 bilhões são ativados para cada token. Este lançamento é voltado para cargas de trabalho de agentes de longo alcance, incluindo desenvolvimento de código por IA, engenharia de software, análise financeira e trabalho profissional com conhecimento. O modelo suporta uma janela de contexto de um milhão de tokens e aceita entradas tanto textuais quanto gráficas. A StepFun informou que o acesso via API já está aberto, e os pesos do modelo serão disponibilizados publicamente em 15 de outubro.

Em vez de expandir a rede, o Step 5 Preview utiliza uma arquitetura Transformer estreita e profunda, composta por 92 camadas. A empresa afirma que pilhas mais profundas fornecem caminhos de transmissão de informação mais longos para raciocínio implícito de múltiplas etapas durante o preenchimento inicial prolongado, quando os agentes realizam buscas, executam código e processam resultados de uso de ferramentas. Para manter a praticidade das sessões de um milhão de tokens, o modelo inclui atenção esparsa com agrupamento de consultas (Sparse Grouped-Query Attention) com agregação de tokens em blocos. Segundo a StepFun, isso reduz o custo de seleção do indexador e top-k em cerca de um oitavo em comparação com um modelo base mais denso, ao mesmo tempo que agrupa seleções vizinhas sobrepostas.

Durante o treinamento, o foco foi no aprendizado por reforço com horizonte de longo prazo baseado em política (on-policy long-horizon reinforcement learning), bem como no alinhamento do treinamento e inferência em nível de bits na roteamento MoE. Além disso, métodos como agendamento consciente da carga (load-aware scheduling), decodificação especulativa MTP-3, MoE FP8 e descarregamento de cache KV são aplicados. A StepFun relata um aumento de mais de três vezes na aceleração do processo ponta a ponta de RL para horizonte de longo prazo e uma taxa de perda de registro de amostras abaixo de um por cento. Este modelo também é usado dentro de um pipeline de dados gerenciado por humanos, que gera tarefas complexas verificáveis em escala de milhões, abrangendo ciência, desenvolvimento de software e pesquisa em aprendizado de máquina.

No que diz respeito à análise de inteligência artificial, o Step 5 Preview alcança cerca de 44 pontos no índice de inteligência, que a StepFun classifica entre os melhores modelos de pesos abertos neste sistema de classificação. O custo da API, de acordo com os preços publicados, é de cerca de US$ 1 por milhão de tokens de entrada e US$ 2,7 por milhão de tokens de saída, com uma velocidade de saída de cerca de 100 tokens por segundo. O foco principal do modelo é a arquitetura e a eficiência do agente, o que o diferencia das versões anteriores Step 3.5 Flash e Step 3.7 Flash, enfatizando a profundidade, o contexto longo esparso e o uso confiável de ferramentas em múltiplas etapas antes que os pesos estejam disponíveis em outubro.

Laboratório de IA de Xangai lança versão preliminar do modelo Atria Dawn, baseado na arquitetura MoE com 744 bilhões de parâmetros
Leia mais
pandaily.com

Laboratório de IA de Xangai lança versão preliminar do modelo Atria Dawn, baseado na arquitetura MoE com 744 bilhões de parâmetros

O Laboratório de Inteligência Artificial de Xangai apresentou o Atria Dawn Preview — um modelo de linguagem agente desenvolvido para apoiar processos complexos de pesquisa e engenharia, e não apenas para chats demonstrativos. Esta versão preliminar é baseada na fundação Mixture-of-Experts (MoE) com 744 bilhões de parâmetros, identificada como GLM-5.2.

O modelo possui uma janela de contexto de 256K e é distribuído sob a licença MIT. Checkpoints, tanto os padrão de instrução quanto os quantizados no formato FP8-instruct, estão disponíveis nas plataformas Hugging Face e ModelScope. Além disso, há acesso à API para usuários em regiões internacionais e chinesas.

De acordo com a documentação do modelo e o artigo de acompanhamento no arXiv, o sistema foi treinado usando o Verifiable Experience Pipeline (Pipeline de Experiência Verificável). Este pipeline conecta raciocínios mediados por ferramentas a ambientes executáveis e resultados verificáveis externamente. O conceito principal é o ciclo de execução completo: análise do problema, projeto da solução, chamada de ferramentas, execução de código e experimentos, verificação dos resultados e recuperação de falhas dentro de um feedback contínuo do ambiente, em vez de apenas obter uma resposta única.

O laboratório agrupou as capacidades do modelo para cenários que abrangem descoberta, criação, entrega e segurança cibernética. Esses cenários incluem pesquisa profunda, desenvolvimento de software, preparação de materiais de escritório estruturados e verificação de segurança autorizada.

Na avaliação por 16 benchmarks apresentados pelo laboratório, o Atria Dawn Preview demonstrou o desempenho mais alto em cinco tarefas. Entre elas, AutomationBench com resultado de 53.8, BrowseComp com 92.5, DeepSearchQA com 96.0, BFCL v4 com 77.0 e CyberGym com 86.5. Os outros indicadores permanecem competitivos, mas não são dominantes em comparação com modelos agentes básicos avançados.

Este lançamento difere dos desenvolvimentos anteriores do Laboratório de IA de Xangai, como Intern W0 e trabalhos relacionados ao NCP. Dawn é posicionado como um parceiro agente aberto para projetos científicos e de engenharia multifásicos, e juntamente com o lançamento dos pesos, ativos públicos foram fornecidos no GitHub e no site especial do projeto Atria.

Os desenvolvedores podem baixar os pesos para uso local através de frameworks como SGLang e vLLM, ou usar consoles de API regionais. Clientes no estilo Codex podem interagir com a Responses API usando configurações apenas de modo de texto. No entanto, recomenda-se às equipes reproduzir independentemente os resultados do AutomationBench e das cadeias de ferramentas para tarefas de longo prazo, bem como verificar as condições de licenciamento e implantação. É importante levar em consideração o rótulo 'preview', pois a confiabilidade do agente fora dos conjuntos de dados publicados permanece uma questão em aberto enquanto o laboratório avança de assistentes de tarefas para colaboração em projetos.

Popular