Inspur apresenta o supernó MetaBrain SD200 Ultra com 128 chips domésticos para trabalhar com o modelo Kimi K3
Leia mais
Pandaily
pandaily.com

Inspur apresenta o supernó MetaBrain SD200 Ultra com 128 chips domésticos para trabalhar com o modelo Kimi K3

A Inspur Information apresentou o supernó de inteligência artificial MetaBrain SD200 Ultra na conferência de computação em inteligência artificial AICC2026. Este nó é posicionado como um sistema de classe de capacidade para processar tarefas com trilhões de parâmetros e agentes. O nome oficial em inglês do sistema é Inspur / MetaBrain.

De acordo com os dados da empresa e agências de informação, o nó combina 128 chips de IA domésticos, fornece acesso a 8 TB de memória unificada do acelerador e 64 TB de memória host. Ele é capaz de executar o modelo Kimi K3 da Moonshot AI, que possui 2,8 trilhões de parâmetros, em uma única máquina com latência de geração de token inferior a 5,85 milissegundos, o que equivale a cerca de 170 tokens por segundo para um único usuário, segundo estimativas da Inspur.

As características arquitetônicas do nó incluem a fábrica 3D Hyper Mesh, que garante comunicação nativa sensível à semântica da memória, com latência declarada de 0,69 microssegundos. Também são utilizados interconexões de cobre de curto alcance e memória simétrica, permitindo que os aceleradores acessem diretamente a memória de nós remotos. A Inspur afirma que o tempo de execução da operação AllReduce foi reduzido em aproximadamente 3,5 vezes em comparação com soluções anteriores.

Além disso, os 'superoperadores' integrados para as etapas KDA, gated MLA e MoE do modelo Kimi K3 reduzem o número de operadores em cerca de dez vezes, ao mesmo tempo que aumentam o desempenho de inferência em mais de três vezes. Esses indicadores são declarações do fornecedor. Os materiais também indicam o potencial de suporte a modelos de até 10 trilhões de parâmetros em um único nó.

Outro produto, o MetaBrain HC2000, é um rack com vários aceleradores destinado à inferência de classe de capacidade, com uma taxa de transferência de tokens por investimento declarada de dez vezes, desde que os limites acordados do SLA sejam respeitados. Embora várias publicações descrevam os aceleradores apenas como chips de IA domésticos ou locais, nenhuma das fontes principais analisadas para esta revisão nomeia o fabricante do silício ou o SKU dentro do SD200 Ultra. Portanto, este artigo não atribui o nó a Ascend, Cambricon ou a qualquer outro fornecedor específico.

Histórias semelhantes

Huawei apresenta OceanStor M900 para AI SuperPoDs, fornecendo cache KV comum de petabytes
Leia mais
pandaily.com

Huawei apresenta OceanStor M900 para AI SuperPoDs, fornecendo cache KV comum de petabytes

Durante o evento Huawei Connect 2026, David Wang, diretor presidente, apresentou o sistema de armazenamento de inteligência artificial OceanStor M900, projetado para clusters SuperPoDs usados para inferência em sistemas hiperescalares. Este produto visa resolver o problema da 'parede de memória', que surge quando as janelas de contexto atingem um milhão de tokens e as cargas de trabalho de agentes com múltiplas iterações aumentam o volume do cache KV além das capacidades de HBM e DRAM.

A Huawei posiciona o M900 como um espaço de memória comum de classe petabyte, permitindo que a infraestrutura de IA passe de um design orientado a computação para um projeto colaborativo de recursos de computação, rede e armazenamento. Na plataforma Lingqu OceanStor M900, o cache KV é agregado e distribuído, possibilitando expandir a memória do SuperPoD da memória de acesso rápido do dispositivo para unidades de estado sólido (SSD).

A empresa afirma que um único cluster pode atingir uma capacidade de 64 petabytes, convertendo o cache KV acessível de gigabytes para terabytes em um único NPU e aumentando a taxa de acerto de cache para reutilização de contexto longo. Essa abordagem considera o armazenamento como um complemento à memória de inferência, e não como um nível tradicional de backup ou objeto.

As principais declarações de desempenho estão relacionadas à arquitetura 'três em um', que inclui CPU, rede e controlador de disco, com suporte nativo à semântica KV. A Huawei afirma que os NPUs podem acessar SSDs em um único passo sem a necessidade de tradução de protocolo ou retransmissão através da CPU, reduzindo a latência de acesso de milissegundos para cerca de 60 microssegundos — uma redução de aproximadamente 90%. Além disso, o sistema fornece uma largura de banda agregada do cluster de cerca de 40 TB/s, cerca de 1,5 vezes maior do que nas soluções industriais anteriores. Em um cenário típico de codificação de IA, a Huawei afirma que a largura de banda de tokens pode dobrar e o tempo até o primeiro token pode ser reduzido pela metade.

O controle de custos é alcançado por meio de planejamento adaptativo consciente de KV, que prevê o valor e o ciclo de vida dos dados do cache KV em diferentes mídias. A Huawei declara a possibilidade de atingir até 24 DWPD e aumentar a vida útil das mídias SSD em cerca de 16 vezes, mantendo uma operação estável por três anos com menos substituições de discos. No entanto, operadores independentes precisarão verificar por conta própria as métricas de latência, largura de banda e durabilidade em seus SuperPoDs, mas o M900 é claramente posicionado como infraestrutura de memória para agentes e contexto longo, complementando, e não substituindo, soluções baseadas em chips Ascend ou interconexões NPO.

Popular