Исследователи Xiaomi представили HySparse2 для MiMo-V3, снижающего вычислительные затраты при предварительной обработке токенов
Подробнее
Pandaily
pandaily.com

Исследователи Xiaomi представили HySparse2 для MiMo-V3, снижающего вычислительные затраты при предварительной обработке токенов

Исследователи LLM-Core компании Xiaomi опубликовали в статье на arXiv (2609.26368) архитектуру HySparse2. Эта технология представляет собой гибридное разреженное внимание с механизмом двухуровневого совместного использования ключей-значений (KV sharing) и разработана для работы с задачами агентов класса MiMo-V3, требующими обработки длинных горизонтов.

Официальное брендирование данной разработки включает Xiaomi, MiMo и HySparse2. Данная публикация фокусируется на исследовательской архитектуре и заявленных показателях эффективности, отличаясь от предыдущих обзоров MiMo-V2.6 с открытым весом.

HySparse2 разделяет основную часть модели на самодекодер в стиле YOCO и кросс-декодер. На внешнем уровне механизм KV Bridging соединяет только слои с полным вниманием, при этом кэши KV кросс-декодера проецируются из скрытых состояний самодекодера. На внутреннем уровне усовершенствованное повторное использование KV сохраняет совместное использование в стиле HySparse внутри каждого гибридного блока, однако оно переключается с выбора на уровне блоков на выбор на уровне токенов. Кроме того, вместо отдельной ветви скользящего окна, в разреженные выборы принудительно включается недавнее локальное окно.

Благодаря этим изменениям, этап предварительной обработки (Prefill) может завершиться после самодекодера, минуя слои кросс-декодера при построении кэша. Это особенно полезно в многоходовых агентах, где входные токены в значительной степени состоят из наблюдений инструментов.

При использовании моделей MoE размером 80B-A3B, обученных на идентичных данных и графиках, статья сообщает, что после незначительного дообучения HySparse2 повышает показатели MRCR-v2 и RULER-v2 на 11,30 и 19,81 процентных пункта соответственно, при этом поддерживает более низкие значения AgentPPL и LongPPL в пределах контекста в 256 тысяч токенов. При работе с 1 миллионом токенов анализ демонстрирует снижение FLOPs при предварительной обработке на 2,92× по сравнению с HySparse и на 5,02× по сравнению с Hybrid SWA. Также отмечается, что размер кэша FP8 KV снижается примерно до 2,69 ГБ по сравнению с 6,72 ГБ и 12,09 ГБ для указанных базовых моделей.

Анализ аблиций показывает, что выбор на уровне токенов способствует более сильному поиску при фиксированном бюджете внимания. При масштабировании до 290B-A8B, механизм KV Bridging сохраняет сравнимое качество, одновременно обеспечивая возможность раннего выхода при предварительной обработке. Для специалистов, изучающих исследования китайских LLM-систем, HySparse2 является архитектурным сигналом, стоящим за заявлениями об эффективности MiMo-V3, а не новым релизом с открытым весом.

Популярное