SenseTime lança modelo de geração de imagens SenseNova U1 Pro com suporte a resolução de até 8K via Raccoon e API
Leia mais
Pandaily
pandaily.com

SenseTime lança modelo de geração de imagens SenseNova U1 Pro com suporte a resolução de até 8K via Raccoon e API

A SenseTime apresentou a versão de produção do seu modelo de criação de imagens SenseNova U1 Pro. Este modelo está agora disponível para os usuários através do aplicativo Raccoon da empresa, bem como através do serviço SenseNova API. De acordo com um comunicado transmitido pelo TechNode em 22 de setembro de 2026, a informação foi obtida em um anúncio publicado no Sina Finance. O nome oficial em inglês do produto é SenseTime / SenseNova.

Este lançamento difere da cobertura anterior da pesquisa SenseNova U1.5 e do código aberto de treinamento. A SenseTime afirma que o U1 Pro utiliza uma cadeia de raciocínio alternada com o processo de texto-imagem para criar materiais visuais contendo informações estruturadas e texto legível diretamente na tela, bem como layouts adequados para produção.

Em vez de tratar legendas e pixels como etapas separadas, o modelo integra as etapas de raciocínio com a formação da imagem. Isso garante que a hierarquia do layout, o posicionamento da tipografia e os elementos gráficos permaneçam consistentes durante todo o processo de geração. O produto suporta a saída de imagens com resolução de até 8K e permite definir proporções personalizadas, o que visa o trabalho com grandes formatos e alta definição, e não apenas cortes quadrados para redes sociais.

O anúncio lista objetivos-alvo, incluindo infográficos, pôsteres, visualizações arquitetônicas e outro conteúdo que requer estilo e composição uniformes em toda a peça finalizada. Esses cenários destacam a necessidade de controle de composição e renderização de texto dentro da própria imagem, em vez de usar uma ferramenta de composição separada após a conclusão da geração. Assim, as equipes de marketing e design podem solicitar quadros prontos para produção a partir de um único pedido.

A distribuição ocorre por dois canais: consumidores e criadores têm acesso via Raccoon, enquanto equipes de produto podem usar o acesso programático via SenseNova API para integrar a geração em seus fluxos de trabalho. A SenseTime não publicou uma ficha de modelo pública completa com dados de parâmetros, termos de licenciamento ou tabelas de benchmark independentes no resumo do TechNode em inglês. Portanto, recomenda-se aos compradores que considerem as alegações sobre o limite de 8K e as capacidades de layout como declarações da empresa até que haja avaliações de terceiros. Para compradores de sistemas multimodais que monitoram modelos de imagem chineses, o sinal mais próximo é a existência de um SKU U1 Pro pronto para produção nos canais Raccoon e API com uma clara limitação de ultra alta resolução.

Histórias semelhantes

SenseTime lança SenseNova U1.5: modelo de 8 bilhões de parâmetros para visão unificada com código aberto de treinamento
Leia mais
pandaily.com

SenseTime lança SenseNova U1.5: modelo de 8 bilhões de parâmetros para visão unificada com código aberto de treinamento

A SenseTime apresentou o SenseNova U1.5, um modelo com oito bilhões de parâmetros que unifica a compreensão, o raciocínio e a geração no espaço de pixels em um sistema multimodal nativo único.

Diferentemente dos pipelines existentes, que utilizam um codificador de visão para percepção e um autoencoder variacional separado para síntese, o U1.5 mapeia pixels e texto em uma estrutura comum sem esses módulos externos. Isso se alinha à linha NEO-unify da empresa, ao mesmo tempo que melhora a reconstrução espacial para alcançar maior precisão em resoluções de produção.

A alteração arquitetônica consiste na substituição da decodificação independente de patches MLP por um decodificador espacial leve. Os tokens visuais são transformados em um campo de características bidimensional e, em seguida, restaurados usando estágios de Pixel Shuffle e convoluções locais, permitindo que regiões adjacentes troquem informações antes da finalização dos pixels.

A SenseTime informou que a interface ainda exibe cada área de 32x32 em um token visual, mas suporta geração nativa até 4K com menos falhas de costura e heterogeneidade de textura em comparação com a versão anterior U1. Isso foi possível graças ao condicionamento de ruído que considera a resolução em proporções de aspecto mais amplas.

O processo pós-treinamento segue uma receita de especialização, seguida por unificação. Especialistas em aprendizado por reforço focam na estética visual, renderização bilíngue de texto, maquetes de infográficos e edição de imagens. Em seguida, a destilação multi-experta baseada em política combina essas habilidades em um único aluno ao longo de suas próprias trajetórias de geração.

A SenseTime afirma que os resultados do U1.5 superam os do U1 em conjuntos de dados de geração e edição de imagens, incluindo renderização bilíngue de texto competitiva e edição multi-referência, mantendo, no geral, altas pontuações de compreensão multimodal em benchmarks padrão de STEM, VQA e OCR.

Juntamente com o relatório técnico publicado no arXiv e Hugging Face Papers, a SenseTime disponibiliza o código de treinamento, que abrange ajuste fino controlado, aprendizado por reforço e destilação de política. Os ativos do modelo estão disponíveis nas coleções SenseNova e Hugging Face sob a organização OpenSenseNova. Este lançamento representa um produto completo U1.5, e não uma versão preliminar U1.5-Lite-Preview, e é destinado a desenvolvedores que desejam obter um modelo de visão unificado nativo compacto para explorar, ajustar e retreinar completamente.

Kinetix AI capta rodada de financiamento anjo de US$ 75 milhões para desenvolver hardware de modelos de IA
Leia mais
ventureburn.com

Kinetix AI capta rodada de financiamento anjo de US$ 75 milhões para desenvolver hardware de modelos de IA

Engenheiros enfrentaram por muito tempo um problema: a inteligência artificial capaz de escrever romances em segundos tem dificuldades em pegar vidro frágil sem esmagá-lo. Este problema está ligado a uma lacuna significativa entre a inteligência digital e a execução física.

Para preencher essa lacuna, é necessária um feedback impecável e contínuo entre os sistemas de software e os corpos mecânicos. Para resolver este problema específico, a Kinetix AI captou US$ 75 milhões em uma grande e significativa rodada de financiamento anjo, o que representa um grande avanço no campo da inteligência incorporada.

A rodada histórica de financiamento foi liderada pela Vertex Ventures, uma poderosa subsidiária de capital de risco da Temasek Holdings de Singapura. F&G Venture e Wanshi Capital também se juntaram à rodada para investir mais de 500 milhões de yuans (aproximadamente US$ 75 milhões) na Kinetix AI, uma startup em estágio inicial.

A Kinetix AI não é um pequeno projeto de garagem. Fundada em setembro de 2025, a empresa cresceu rapidamente para quase 200 funcionários. Por trás do rápido crescimento da Kinetix AI está o CEO Yu Ze, que anteriormente comercializou caminhões de mineração autônomos da Huawei.

A equipe também inclui Luo Ping, um brilhante vice-decano da HKU, e Zheng Qunyuan, ex-chefe de robótica na XPeng. Este grupo possui profundo conhecimento combinado de teoria acadêmica, lógica de veículos autônomos e capacidades de produção.

Muitas empresas de robótica economizam na qualidade, mas a Kinetix não aceita isso. A empresa acredita firmemente que, como a infraestrutura do mundo foi criada para os humanos, os robôs devem parecer e se mover exatamente como nós para se integrar perfeitamente.

Sua criação principal, KAIBot, tem 1,73 metros de altura e impressionantes 115 graus de liberdade. Ele se destaca pela alta qualidade e ultrarrealismo. Embora a criação de tal robô exija custos iniciais significativamente maiores e a cadeia de suprimentos seja um pesadelo, o cofundador Zheng Qunyuan afirma que começar com equipamentos baratos e de baixa qualidade é simplesmente estúpido. Ao fixar o verdadeiro formato humano, eles garantem que seus modelos de IA não falharão assim que qualquer junta for atualizada.

Imagine um robô que não apenas imita o contorno humano, mas corresponde perfeitamente aos dados de movimento humano. Quando o hardware reflete diretamente nossa biologia, o trabalho algorítmico é transmitido sem esforço.

A mágica principal acontece graças ao capital atraído, que é direcionado para acelerar seu ecossistema fechado. Isso pode ser imaginado como um monstro de três cabeças. Primeiro, é a coleta de dados multimodais e egocêntricos. Em seguida, esses dados brutos são alimentados diretamente no modelo fundamental nativo, incorporado no corpo. Finalmente, o hardware, como KAIBot e o braço altamente manobrável KAI Hand, executa fisicamente as ações aprendidas.

Este ciclo contínuo cria um «volante de inteligência». Como o robô coleta dados sensoriais do mundo real, o modelo de IA se torna mais inteligente, aumentando instantaneamente as capacidades do hardware físico. Não é mais necessário reconfigurar a máquina física a cada atualização de software.

A dinâmica do sistema foi demonstrada nos Jogos Mundiais de Robótica para Humanos em 2026, onde seu sistema jogou tênis de mesa contra a campeã mundial Din Ning. O objetivo é criar robôs de classe premium, prontos para tarefas complexas no mundo real.

Popular