Plataforma openJiuwen da Huawei fornece interface de voz e vídeo full-duplex para trabalho em NPUs Ascend
Leia mais
Pandaily
pandaily.com

Plataforma openJiuwen da Huawei fornece interface de voz e vídeo full-duplex para trabalho em NPUs Ascend

OpenJiuwen, uma plataforma de código aberto para agentes de IA desenvolvida em colaboração com os laboratórios Huawei 2012, Huawei Cloud e equipes de dispositivos e computação da empresa, bem como universidades e outros desenvolvedores, implementou no WorkSwarm — sua área de trabalho aberta para tarefas de escritório e codificação — a capacidade de interação multimodal com comunicação full-duplex.

A atualização, anunciada em 1º de outubro, permite que os usuários se comuniquem com o agente como em uma chamada telefônica normal, enquanto outro agente continua a executar tarefas mais longas em segundo plano.

Princípio de funcionamento da interação full-duplex

Comunicação full-duplex significa que o assistente pode ouvir e falar simultaneamente. Diferentemente dos assistentes de voz tradicionais que operam sob o princípio de rádio, onde o usuário é forçado a esperar pelo término da resposta da IA, agora o usuário pode interromper a resposta no meio, por exemplo, pedindo para ignorar o fundo e passar para as conclusões.

Quando o WorkSwarm detecta um novo comando de voz real, ele interrompe a resposta atual e processa a nova instrução; ao mesmo tempo, o texto gerado anteriormente é salvo no registro da tarefa. Para minimizar interrupções falsas causadas por ruídos de fundo, são usadas funções de detecção de atividade de voz e supressão de ruído.

Arquitetura de divisão de tarefas

A estrutura divide o trabalho em dois fluxos. O modelo em tempo real monitora o fluxo de vídeo, reage rapidamente e responde, enquanto o Agente Principal cuida da decomposição de tarefas, chamada de ferramentas e avanço do processo. O usuário pode apontar a câmera para um produto, perguntar sobre sua marca e, em seguida, pedir ao WorkSwarm para realizar uma pesquisa e redigir um documento. A pesquisa é executada em segundo plano enquanto a conversa continua, e a interface exibe o status da tarefa, os registros de chamada de ferramentas, os resultados obtidos e os arquivos criados.

Após a conclusão da tarefa em segundo plano, o WorkSwarm primeiro publica um resumo escrito e aguarda o término do diálogo oral atual antes de vocalizar apenas os pontos chave. Solicitações subsequentes são colocadas em fila, e os usuários podem alterar a ordem das tarefas, mover uma para o topo ou pausar tarefas pendentes ou em execução. Interromper a conversa não cancela as tarefas instrumentais, que devem ser interrompidas separadamente, e fechar a sessão de áudio e vídeo não interrompe o trabalho já delegado ao Agente Principal. Os resultados são retornados ao diálogo original.

Atualmente, o WorkSwarm suporta dois protocolos de modelos: Qwen Omni em tempo real via WebSocket, que pode usar um endpoint oficial ou implantação local, e JoyAI, que conecta modelos individuais de reconhecimento de fala, linguagem e síntese de fala através de APIs oficiais ou outras plataformas. Modelos multimodais com comunicação full-duplex também podem ser implantados em NPUs Ascend através da plataforma ModelArts da Huawei Cloud usando o framework de inferência vLLM-Omni. O WorkSwarm oferece instaladores para Windows, Mac e HarmonyOS, bem como pacotes pip, e seu repositório no GitHub é licenciado sob Apache-2.0. O último lançamento marcado do projeto, v0.2.7 de 30 de setembro, adicionou o Serviço de Contexto Proativo e sessões interagentes.

Histórias semelhantes

Xiaomi libera pesos e recursos para os modelos MiMo-V2.6 Pro e MiMo-V2.6 Flash usando pilha RL
Leia mais
pandaily.com

Xiaomi libera pesos e recursos para os modelos MiMo-V2.6 Pro e MiMo-V2.6 Flash usando pilha RL

A Xiaomi disponibilizou publicamente pesos, documentação técnica e recursos de aprendizado por reforço (reinforcement learning) para sua série MiMo-V2.6. De acordo com notas em inglês da Xiaomi de 22 de setembro, os repositórios MiMo-V2.6-Pro e MiMo-V2.6-Flash foram publicados na plataforma Hugging Face juntamente com o código RL e mais de 7000 ambientes de teste.

Este lançamento consiste no fornecimento de pesos e código, o que difere da cobertura anterior do processo de treinamento RL através de transmissão ao vivo. A marca permanece inalterada: Xiaomi / MiMo.

Os modelos Pro e Flash são posicionados como modelos multimodais nativos, com uma janela de contexto declarada de um milhão de tokens. Os cartões dos modelos e relatórios adicionais em inglês indicam que o modelo Pro possui uma arquitetura de mistura esparsa de especialistas (sparse mixture-of-experts) com um total de parâmetros de cerca de 1,02 trilhão, utilizando ativamente aproximadamente 42 bilhões de parâmetros. O modelo Flash é avaliado em 309 bilhões de parâmetros totais com uma atividade de cerca de 15 bilhões.

A Xiaomi informa que cada modelo passou por 30 etapas de RL em aproximadamente 750.000 trajetórias em menos de seis dias. O processo utilizou uma mistura de tarefas, incluindo codificação, trabalho de agente geral, tarefas visuais e cibersegurança. Em cada atualização, foram utilizados cerca de 1568 solicitações e 16 execuções, e o volume de dados por etapa foi de 3,5 a 3,7 bilhões de tokens.

De acordo com a empresa, houve um aumento de desempenho nas tarefas de treinamento de cerca de 25% para o Flash e de 12% para o Pro. Além disso, foram observadas melhorias no DeepSWE v1.1: de 48,8 para cerca de 65,7 para o Flash e de 58,4 para cerca de 72,6 para o Pro, embora esses indicadores sejam dados fornecidos pelo fornecedor e exijam confirmação por terceiros.

Os ativos disponíveis vão além de simples checkpoints. A Xiaomi forneceu um framework RL abrangente, construído sobre verl e mecanismos de agentes relacionados, mais de 7000 ambientes classificados cobrindo desenvolvimento de software, reprodução de vulnerabilidades, trabalho intelectual e design web. Também estão disponíveis o ponto de partida Distill-Qwen-9B para experimentos da comunidade em RL e componentes leves para treinamento multicanal. O custo da API para as versões Pro e Flash hospedadas é declarado como correspondente ao MiMo-V2.5, enquanto o nível UltraSpeed promete uma largura de banda até 20 vezes maior que o Pro padrão mantendo a qualidade.

No entanto, os engenheiros ainda enfrentam custos elevados de manutenção de grandes MoE, e as declarações da Xiaomi sobre análise artificial e benchmarks de agentes necessitam de reprodução externa. A principal notícia é o pacote completo MiMo-V2.6 com pesos abertos, código RL e ambientes que os laboratórios podem estudar, em vez de apenas uma representação gráfica em transmissão ao vivo.

Popular