Bilibili выпустила семейство моделей машинного перевода Index-Translate на базе Qwen3.5 для 150 языков
Подробнее
Pandaily
pandaily.com

Bilibili выпустила семейство моделей машинного перевода Index-Translate на базе Qwen3.5 для 150 языков

Команда Index LLM компании Bilibili представила Index-Translate — семейство многоязычных моделей перевода, разработанных на основе Qwen3.5 от Alibaba. Эти текстовые модели поддерживают 150 языков, включая китайский и английский, и доступны под лицензией Apache-2.0 на платформах Hugging Face и ModelScope. Они выпускаются в размерах 2B, 9B и 35B-A3B (предварительная версия), а также сопровождаются техническим отчетом, кодом на GitHub и онлайн-демонстрацией.

Функциональность моделей выходит за рамки простого перевода; они способны следовать инструкциям относительно терминологии, форматирования и сохранения неизменным контента. Например, в одном примере модель 9B перевела уведомление об обслуживании игры в формате JSON на корейский язык, сохранив при этом его структуру, звездочки и хештег, которые пользователь просил сохранить.

Семейство моделей расширяется тремя специализированными ветвями. Index-Echo генерирует переведенные субтитры или озвучку, сохраняя при этом характеристики голоса исходного диктора. Его пакетный релиз преобразования речи в речь охватывает переводы с китайского на английский, испанский и японский, а также с английского на китайский, испанский и японский. Модель Index-Homura настраивает перевод с учетом целевого количества слогов, что критично для дубляжа и субтитров. А Index-NativeLong, доступный под идентификаторами Index-Nailong, занимается переводом целых документов, обеспечивая согласованность ссылок между ними.

Примеры, представленные Bilibili, основаны на контенте собственного сообщества. Когда модель 9B обрабатывала сленговое выражение геймера о желании поиграть в Final Fantasy XIV, она перевела его как «When the FFXIV itch hits, just go play.». В фантастическом тексте объемом около 32 000 токенов, где имя персонажа могло быть истолковано как королевский титул, модель для длинных документов сохранила это имя последовательно, тогда как та же модель 9B, работая по частям, допускала другие варианты перевода.

Согласно внутренним бенчмаркам команды, предварительная версия 35B-A3B показала результат 0.8794 на FLORES (COMET-22) и 76.76 по оценке судьи WMT26. Модель 9B достигла показателей 0.8789 и 75.35. Стоит отметить, что некоторые крупные общие модели демонстрируют более высокие результаты на WMT26, включая DeepSeek-V4.1-Flash с результатом 83.55. При работе с низкоресурсными задачами следования инструкциям модель 9B показала наилучший балл по инструкциям — 0.7725 — и самый низкий показатель отклонения от цели — 3.47% среди всех сравниваемых моделей. Модель Index-Homura-9B в 81.92% случаев попадает в заданное количество слогов в пределах 10% согласно тесту SandGlass команды.

Команда также разработала собственные бенчмарки для контроля следования инструкциям, игрового сленга и управления слогами. Репозиторий включает расширение для браузера, позволяющее переводить веб-страницы с использованием локально развернутой модели, а также конвейер для дубляжа видео. Bilibili планирует выпустить официальную модель 35B-A3B, сделать свои бенчмарки открытыми, добавить языки в Index-Echo и опубликовать более крупные модели.

Похожие сюжеты

TaichuAI выпустила открытую мультимодальную модель ZDTaichu5.0-9B для пространственного понимания
Подробнее
pandaily.com

TaichuAI выпустила открытую мультимодальную модель ZDTaichu5.0-9B для пространственного понимания

Компания TaichuAI сделала модель ZDTaichu5.0-9B общедоступной. Эта мультимодальная фундаментальная модель имеет приблизительно 9 миллиардов параметров и предназначена для общего визуального понимания, пространственного рассуждения, использования агентских инструментов и исследований в области воплощенного ИИ.

Архитектура модели объединяет языковой бэкбон Qwen3.5-9B с кодировщиком зрения C-RADIOv4-H. Модель принимает на вход текст, а также одно или несколько изображений и видео любого разрешения, поддерживая длину контекста до 128 тысяч токенов. Издание, которое обобщила TMTPost 15 сентября, было сосредоточено на восприятии пространства в реальном мире, преобразованиях между разными видами и планировании задач для воплощенных систем.

Согласно публичной карточке модели, TaichuAI демонстрирует первоклассные результаты среди примерно 10-миллиардных общих VLMs по широкому спектру визуальных задач, а также расширяет свои возможности в пространственных, воплощенных и агентских сценариях. Среди отмеченных показателей в области пространства и воплощенности выделяются ViewSpatial 62.50, MMSI-Bench 47.20, MindCube-tiny 78.27, ERQA 48.00 и RoboSpatial 56.00.

В отношении наборов для агентов и инструкций, указанных в примечаниях к оценке на карточке, TAU2-Bench достигает показателя 87.70, а средний показатель Claw-Eval составляет 71.40, при этом IFEval показывает 93.70. Механизм энтропийно-приоритированного адаптивного рекурсивного рассуждения описывается как механизм, который выделяет дополнительные шаги уточнения латентных переменных для более сложных токенов.

Возможности модели охватывают распознавание оптических символов (OCR) и понимание документов, математику на изображениях, тонкие двумерные взаимосвязи, ассоциацию нескольких видов, восприятие трехмерных сцен и перспективы, а также отслеживание множества изображений и видео в рамках длинного окна контекста, включая планирование многоэтапного использования инструментов. При этом фактическое выполнение инструментов остается обязанностью хост-приложения.

Темы пространственного обучения, перечисленные на карточке, включают относительные отношения, плотный подсчет и рамки, движение камеры и упорядочивание глубины, эгоцентрические против аллоцентрических видов, а также высокоуровневое определение возможностей и планирование действий для адаптации в стиле VLA.

Веса модели размещены на Hugging Face по адресу TaichuAI/ZDTaichu5.0-9B под лицензией NVIDIA Open Model License, сохраняя при этом уведомления Apache-2.0 от Qwen3.5. Для обслуживания используется кастомная ветка vLLM 0.26.0 и образ Docker от TaichuAI для обеспечения конечных точек, совместимых с OpenAI, с рекомендуемыми настройками выборки для пространственной привязки и общих задач.

Как и в случае с другими моделями, представленными вендорами, внешним лабораториям следует рассматривать показатели бенчмарков как заявленные при указанных подсказках и судьях до момента появления результатов независимого воспроизведения. Однако сочетание среднеразмерной открытой мультимодальной контрольной точки, акцента на пространстве и агентах, а также готовой упаковки vLLM предоставляет исследователям конкретный артефакт для оценки.

Популярное