Bilibili lança a família de modelos de tradução automática Index-Translate baseada em Qwen3.5 para 150 idiomas
Leia mais
Pandaily
pandaily.com

Bilibili lança a família de modelos de tradução automática Index-Translate baseada em Qwen3.5 para 150 idiomas

A equipe do Index LLM da Bilibili apresentou o Index-Translate — uma família de modelos de tradução multilíngue desenvolvidos com base no Qwen3.5 da Alibaba. Esses modelos de texto suportam 150 idiomas, incluindo chinês e inglês, e estão disponíveis sob a licença Apache-2.0 nas plataformas Hugging Face e ModelScope. Eles são lançados nos tamanhos 2B, 9B e 35B-A3B (versão preliminar), e são acompanhados por um relatório técnico, código no GitHub e demonstração online.

A funcionalidade dos modelos vai além da simples tradução; eles são capazes de seguir instruções relativas à terminologia, formatação e manutenção de conteúdo inalterado. Por exemplo, em um caso, o modelo 9B traduziu uma notificação de serviço de jogo em formato JSON para coreano, mantendo sua estrutura, asteriscos e hashtag, conforme solicitado pelo usuário.

A família de modelos se expande em três ramificações especializadas. O Index-Echo gera legendas ou dublagens traduzidas, preservando as características da voz do locutor original. Seu pacote de conversão de fala para fala em lote abrange traduções de chinês para inglês, espanhol e japonês, bem como de inglês para chinês, espanhol e japonês. O modelo Index-Homura ajusta a tradução de acordo com o número alvo de sílabas, o que é crítico para dublagem e legendagem. E o Index-NativeLong, disponível sob os identificadores Index-Nailong, lida com a tradução de documentos inteiros, garantindo a consistência das referências entre eles.

Os exemplos apresentados pela Bilibili são baseados no conteúdo da própria comunidade. Quando o modelo 9B processou uma expressão gíria de gamer sobre querer jogar Final Fantasy XIV, ele a traduziu como «When the FFXIV itch hits, just go play.». Em um texto de ficção de cerca de 32.000 tokens, onde o nome do personagem poderia ter sido interpretado como um título real, o modelo para documentos longos manteve esse nome consistentemente, enquanto o mesmo modelo 9B, trabalhando em partes, permitia outras opções de tradução.

De acordo com benchmarks internos da equipe, a versão preliminar 35B-A3B obteve um resultado de 0.8794 no FLORES (COMET-22) e 76.76 na avaliação do juiz WMT26. O modelo 9B alcançou os índices de 0.8789 e 75.35. Vale notar que alguns grandes modelos gerais demonstram resultados mais altos no WMT26, incluindo o DeepSeek-V4.1-Flash com um resultado de 83.55. Ao lidar com tarefas de baixa disponibilidade de recursos de seguimento de instruções, o modelo 9B mostrou a melhor pontuação em instruções — 0.7725 — e a menor taxa de desvio do objetivo — 3.47% entre todos os modelos comparados. O modelo Index-Homura-9B atinge o número de sílabas especificado em 81.92% dos casos dentro de 10%, de acordo com o teste SandGlass da equipe.

A equipe também desenvolveu seus próprios benchmarks para monitorar o seguimento de instruções, gírias de jogos e controle de sílabas. O repositório inclui uma extensão de navegador que permite traduzir páginas da web usando um modelo implantado localmente, bem como um pipeline para dublagem de vídeo. A Bilibili planeja lançar o modelo oficial 35B-A3B, tornar seus benchmarks públicos, adicionar idiomas ao Index-Echo e publicar modelos maiores.

Histórias semelhantes

TaichuAI lança o modelo multimodal aberto ZDTaichu5.0-9B para compreensão espacial
Leia mais
pandaily.com

TaichuAI lança o modelo multimodal aberto ZDTaichu5.0-9B para compreensão espacial

A empresa TaichuAI tornou o modelo ZDTaichu5.0-9B público. Este modelo fundamental multimodal possui aproximadamente 9 bilhões de parâmetros e é projetado para compreensão visual geral, raciocínio espacial, uso de ferramentas de agente e pesquisa em IA incorporada.

A arquitetura do modelo combina o backbone de linguagem Qwen3.5-9B com o codificador de visão C-RADIOv4-H. O modelo aceita texto, bem como uma ou mais imagens e vídeos de qualquer resolução, suportando um comprimento de contexto de até 128 mil tokens. A publicação, resumida pela TMTPost em 15 de setembro, concentrou-se na percepção do espaço no mundo real, transformações entre diferentes vistas e planejamento de tarefas para sistemas incorporados.

De acordo com o cartão público do modelo, a TaichuAI demonstra resultados de primeira linha entre os VLMs gerais de cerca de 10 bilhões, em uma ampla gama de tarefas visuais, além de expandir suas capacidades em cenários espaciais, incorporados e de agentes. Entre as métricas destacadas em espaço e incorporação estão ViewSpatial 62.50, MMSI-Bench 47.20, MindCube-tiny 78.27, ERQA 48.00 e RoboSpatial 56.00.

Em relação aos conjuntos de agentes e instruções mencionados nas notas de avaliação no cartão, o TAU2-Bench atinge 87.70, e a pontuação média do Claw-Eval é de 71.40, enquanto o IFEval mostra 93.70. O mecanismo de raciocínio adaptativo recursivo priorizado por entropia é descrito como um mecanismo que destaca etapas adicionais de refinamento de variáveis latentes para tokens mais complexos.

As capacidades do modelo abrangem reconhecimento óptico de caracteres (OCR) e compreensão de documentos, matemática em imagens, relações bidimensionais sutis, associação de múltiplas vistas, percepção de cenas tridimensionais e perspectiva, bem como rastreamento de múltiplas imagens e vídeos dentro de uma longa janela de contexto, incluindo planejamento de uso de ferramentas em várias etapas. No entanto, a execução real das ferramentas permanece responsabilidade da aplicação hospedeira.

Os tópicos de aprendizado espacial listados no cartão incluem relações relativas, contagem densa e quadros, movimento de câmera e ordenação de profundidade, vistas egocêntricas versus alocêntricas, bem como definição de alto nível de capacidades e planejamento de ações para adaptação no estilo VLA.

Os pesos do modelo estão disponíveis no Hugging Face em TaichuAI/ZDTaichu5.0-9B sob a licença NVIDIA Open Model License, mantendo os avisos Apache-2.0 do Qwen3.5. Para serviço, é usada uma branch customizada vLLM 0.26.0 e uma imagem Docker da TaichuAI para fornecer endpoints compatíveis com a OpenAI, com configurações de amostragem recomendadas para fixação espacial e tarefas gerais.

Assim como no caso de outros modelos apresentados por fornecedores, laboratórios externos devem considerar as pontuações dos benchmarks como declaradas com os prompts e juízes especificados até que os resultados de reprodução independente apareçam. No entanto, a combinação de um ponto de controle multimodal aberto de tamanho médio, foco em espaço e agentes, e um pacote vLLM pronto fornece aos pesquisadores um artefato concreto para avaliação.

Popular