Meituan выпустила модель LongCat-2.5-Preview: мультимодальный агент с 1.6 триллиона параметров и контекстом в 1 миллион токенов
Подробнее
Pandaily
pandaily.com

Meituan выпустила модель LongCat-2.5-Preview: мультимодальный агент с 1.6 триллиона параметров и контекстом в 1 миллион токенов

Компания Meituan представила LongCat-2.5-Preview на своей платформе LongCat API 25 сентября 2026 года. Согласно информации от iFeng Tech, AI Tool Lab и связанных с продуктом изданий, этот релиз позиционируется как долгосрочная мультимодальная модель-агент, а не просто обновление чат-функций. Официальное английское наименование продукта — Meituan / LongCat.

В данном обзоре представлены технические характеристики Превью-продукта и целевое назначение программного обеспечения агентов. Meituan не опубликовала официальных бенчмарков для этого выпуска, поэтому заявления о возможностях следует рассматривать с осторожностью.

Архитектурно модель сохраняет подход Mixture-of-Experts, который использовался в LongCat-2.0. Общий объем параметров составляет около 1,6 триллиона, при этом примерно 48 миллиардов параметров активируются на каждом шаге инференса. Модель обладает встроенным окном контекста в один миллион токенов, что делает ее подходящей для обработки длинных документов, репозиториев, журналов и многоходовых циклов инструментов.

Основное отличие от версии 2.0 заключается во внедрении нативной мультимодальной способности непосредственно в базовую модель. Это включает парсинг изображений для вопросов и ответов между модальностями, а также визуальное рассуждение и суммирование. Кроме того, произошел явный переход от чисто агентского кодирования к автономному управлению рабочими процессами в терминалах, браузерах, графических интерфейсах пользователя, электронных таблицах и инструментах дизайна.

Доступ к модели предоставляется в двух форматах: через API (с конечными точками, совместимыми с OpenAI и Anthropic, которые описаны в обзорах) и через веб-интерфейс по адресу longcat.chat. Максимальная длина выходного текста установлена на уровне 128 тысяч токенов.

Интеграционные заметки упоминают такие инструменты, как Codex, OpenCode, OpenClaw, CatPaw, Claude Code, Hermes и Kilo Code, что позволяет существующим системам агентов напрямую обращаться к Превью-версии. В второстепенных отчетах приводятся рекламные цены, указывающие на ограниченное по времени входное использование по цене около 0,30 доллара и выходное — около 1,20 доллара за миллион токенов, с дополнительным уровнем ввода с кешем и бесплатными токенами для текущих пользователей; коммерческие условия следует рассматривать как временные предложения Превью.

Поскольку LongCat-2.5-Preview не сопровождается публичным рейтингом в этом цикле, читателям рекомендуется воспринимать улучшения в программном обеспечении агентов как заявку на позиционирование, ожидающую независимой оценки. Для разработчиков, следящих за мультимодальными агентами в Китае, ключевая информация заключается в том, что Meituan представила модель 1.6T / ~48B MoE с нативным контекстом в 1М, ориентированную на длинные цепочки операций с программным обеспечением, а не на финансовые истории или изменение позиций в рейтингах.

Похожие сюжеты

StepFun выпустила предварительную версию модели Step 5: агент с 600 млрд параметров и открытые веса ожидаются 15 октября
Подробнее
pandaily.com

StepFun выпустила предварительную версию модели Step 5: агент с 600 млрд параметров и открытые веса ожидаются 15 октября

StepFun представила предварительную версию Step 5 20 сентября 2026 года как свою следующую флагманскую базовую модель, предназначенную для работы агентов с длинным горизонтом, согласно информации от Tencent Tech, карточек моделей DataLearner и материалов компании, доступных на stepfun.com. Официальное английское наименование модели — StepFun / Step 5.

Важно отметить, что хотя идентификатор модели step-5-preview уже доступен через API продукта и открытую платформу StepFun, открытые веса в формате BF16 запланированы только на 15 октября 2026 года и не были доступны на момент запуска. Следовательно, доступность через API и открытость весов следует рассматривать как отдельные моменты.

Архитектура модели представляет собой разреженную смесь экспертов (MoE) с общим количеством параметров около 600 миллиардов. При этом примерно 27 миллиардов параметров активируются на каждый токен в рамках 92-слойного Трансформера типа «узкий и глубокий». Выбор глубины обусловлен потребностями агентов, поскольку более длинные пути информации через слои способствуют улучшению многошагового неявного рассуждения и обработки длинных результатов инструментов.

Модель поддерживает контекстное окно в один миллион токенов, принимая как текстовый, так и графический ввод (хотя видеоввод упоминается на сторонних карточках). Она ориентирована на применение в области ИИ-кодирования, разработки программного обеспечения, финансового анализа и использования профессиональных агентов. Для поддержания практичности внимания на миллион токенов, было применено разреженное GQA в сочетании с блочным объединением токенов, что снижает стоимость индексатора и выбора топ-k примерно до одной восьмой.

В процессе обучения особое внимание уделялось выравниванию битового уровня между обучением и выводом для обеспечения стабильности маршрутизации MoE, а также использовались планирование с учетом нагрузки, спекулятивное декодирование и пути FP8. StepFun утверждает, что эти методы ускоряют процесс обучения с подкреплением (RL) с длинным горизонтом в целом более чем в три раза.

Согласно данным, композитный индекс искусственного анализа от Artificial Analysis составляет 44 балла. Компания размещает эту оценку среди ведущих моделей, ориентированных на открытый доступ. На агрегаторных карточках также указаны цены API: около 1,00 доллара за входной токен и 2,70 доллара за выходной токен на миллион токенов, однако следует рассматривать сравнения по показателям и стоимости как заявления третьих сторон или поставщиков.

До даты 15 октября Step 5 Preview следует воспринимать прежде всего как действующий API для агентов с длинным горизонтом, имеющий лишь запланированное обязательство по открытым весам, а не как релиз весов на Hugging Face или как взаимозаменяемый продукт с Meituan LongCat, MiniMax Code Flash или NaiveAI OSS MoE.

StepFun выпустила предварительную версию Step 5: модель с 600 млрд параметров, разреженным MoE и контекстом в 1 млн токенов
Подробнее
pandaily.com

StepFun выпустила предварительную версию Step 5: модель с 600 млрд параметров, разреженным MoE и контекстом в 1 млн токенов

Компания StepFun представила предварительную версию модели Step 5, которая является базовой моделью с разреженной архитектурой Mixture-of-Experts (MoE) и имеет около 600 миллиардов общих параметров, при этом примерно 27 миллиардов активируются на каждый токен. Этот релиз ориентирован на рабочие нагрузки агентов с длительным горизонтом, включая разработку кода с помощью ИИ, программную инженерию, финансовый анализ и профессиональную работу с знаниями. Модель поддерживает окно контекста в один миллион токенов и принимает как текстовые, так и графические входные данные. StepFun сообщила, что доступ через API уже открыт, а сами веса модели планируется сделать общедоступными 15 октября.

Вместо расширения сети, Step 5 Preview использует узкую, глубокую архитектуру Трансформера, состоящую из 92 слоев. Компания утверждает, что более глубокие стеки обеспечивают более длинные пути передачи информации для неявного многошагового рассуждения во время длительного предварительного заполнения, когда агенты выполняют поиск, запускают код и обрабатывают результаты использования инструментов. Чтобы поддерживать практичность сессий в миллион токенов, модель включает разреженное внимание с группировкой запросов (Sparse Grouped-Query Attention) с объединением токенов по блокам. По словам StepFun, это снижает стоимость выбора индексатора и top-k примерно до одной восьмой по сравнению с более плотной базовой моделью, одновременно объединяя перекрывающиеся соседние выборы.

В процессе обучения акцент сделан на обучении с подкреплением с долгосрочным горизонтом по политике (on-policy long-horizon reinforcement learning), а также на согласовании обучения и инференса на уровне битов в маршрутизации MoE. Кроме того, применяются такие методы, как планирование с учетом нагрузки (load-aware scheduling), спекулятивное декодирование MTP-3, FP8 MoE и выгрузка KV-кэша. StepFun отчитывается о более чем трехкратном ускорении сквозного процесса RL для долгосрочного горизонта и показателе потерь по реестру образцов ниже одного процента. Эта модель также используется внутри конвейера данных, управляемого человеком, который генерирует проверяемые сложные задачи в масштабе миллионов, охватывающие науку, разработку программного обеспечения и исследования в области машинного обучения.

Что касается анализа искусственного интеллекта, Step 5 Preview набирает около 44 баллов по индексу интеллекта, который StepFun относит к числу лучших моделей с открытыми весами в этой рейтинговой системе. Стоимость API, согласно опубликованным ценам, составляет около 1 доллара за миллион входных токенов и 2,7 доллара за миллион выходных токенов, при скорости вывода около 100 токенов в секунду. Основной фокус модели — архитектура и эффективность агента, что отличает ее от предыдущих выпусков Step 3.5 Flash и Step 3.7 Flash, делая акцент на глубине, разреженном длинном контексте и надежном многоэтапном использовании инструментов перед тем, как веса станут доступны в октябре.

Infinigence AI открыла APXInf — движок для инференса воплощенных моделей на периферии Jetson Thor
Подробнее
pandaily.com

Infinigence AI открыла APXInf — движок для инференса воплощенных моделей на периферии Jetson Thor

Компания Infinigence AI совместно с командами из Университета Цинхуа и Шанхайского университета Цзяо Тунг выпустила в открытый доступ APXInf. Этот движок предназначен для инференса на периферии и создан для воплощенных моделей, которые должны замыкать цикл восприятие–решение–действие непосредственно на роботе, а не в облаке.

Публичный пакет доступен на GitHub по адресу RLinf/APXinf-robo и включает среду выполнения на Rust с привязками на Python, ориентированными на устройства класса Jetson и настольные графические процессоры. Компания позиционирует этот релиз как «последнюю милю» между способными моделями типа визуал-язык-действие и стабильным управлением на самом роботе.

Согласно данным Infinigence и освещению от QbitAI, на платформе NVIDIA Jetson Thor, использование формата FP8 с PI 0.5 позволяет сократить сквозной инференс с приблизительных 278 мс до менее чем 26 мс. Это обеспечивает частоту около 38.46 Гц, что достаточно для многосценарийного управления в реальном времени. Данное улучшение представляет собой примерно десятикратное снижение задержки по сравнению с неоптимизированной базовой линией, которую они приводят.

Этот прорыв стал возможен благодаря работе над конвейером, графом, ядром и квантованием, а также благодаря использованию агенто-ассистированного слияния ядер CUDA (Agent4Kernel).

Первоначальная поддержка моделей включает PI 0.5 и WALL-OSS. Целевые аппаратные платформы включают Jetson Orin, Jetson Thor и GeForce RTX 4090. Архитектурные решения акцентируют внимание на долгосрочной стабильности, наряду с пиковой скоростью: используется минимальная среда выполнения на Rust для обеспечения безопасности памяти и эргономика Python для разработчиков. Кроме того, внедрен агентский рабочий процесс для адаптации новых контрольных точек VLA/WAM без необходимости ручного написания каждого пути ядра.

Этот движок интегрируется после более раннего стека обучения с подкреплением RLinf от Infinigence, расширяя ту же открытую экосистему от пост-тренинга до развертывания на роботе с возможностями обслуживания, совместимыми с OpenPI.

В планах развития находятся порты для большего числа моделей VLA/VLM и мировых моделей (уже запланирована работа с классами Qwen и GR00T), оптимизация nvfp4, разработка бэкендов для AMD, а также поддержка отечественных чипов для инференса и операционных систем для отечественных роботов. Командам рекомендуется самостоятельно воспроизвести показатели задержки для Thor/Orin на собственных контрольных точках и в рамках заданных параметров энергопотребления. Указанное значение FP8 ниже 26 мс устанавливает стандарт для инференса воплощенных систем на периферии, но не является гарантией для каждой модели или формы пакета.

Популярное