OpenAI выпустила GPT-6 Sol и Luna — новые модели ИИ с улучшенной производительностью и сниженной стоимостью
Подробнее
Olhar Digital
olhardigital.com.br

OpenAI выпустила GPT-6 Sol и Luna — новые модели ИИ с улучшенной производительностью и сниженной стоимостью

OpenAI объявила во вторник, 22-го числа, о расширении своей новой линейки моделей искусственного интеллекта (ИИ) выпуском GPT-6 Sol и GPT-6 Luna. Эти модели следуют за GPT-6 Astra, который компания представила в начале сентября, и были созданы для предоставления части достижений более мощной версии, но с более низкими затратами.

По данным OpenAI, как Sol, так и Luna были обучены с использованием методологий, аналогичных тем, что применялись в Astra, интегрируя достижения в различных областях, таких как профессиональная деятельность, разработка программного обеспечения, взаимодействие с компьютерами, фактическая точность и согласованность.

Основное различие заключается в соотношении возможностей и цены. Компания сообщила, что оптимизация кэширования и вывода позволила снизить стоимость доступа через API на 50% по сравнению с акционными ценами эквивалентных моделей GPT-5.6.

Производительность в профессиональных задачах и программировании

GPT-6 Sol получил особое внимание для профессиональных приложений и программирования. OpenAI утверждает, что эта модель демонстрирует заметные улучшения по сравнению с GPT-5.6 Sol в тестах, сфокусированных на агентах, способных работать в реальных репозиториях кода.

В бенчмарке FrontierCode 1.1 Main, который оценивает не только функциональность кода, но и такие критерии, как качество тестов, организация и соответствие стандартам проекта, компания сообщила о значительном прогрессе Sol по сравнению с его предшественником.

В другом тесте, DeepSWE v1.1, посвященном сложным задачам разработки программного обеспечения в практических проектах, GPT-6 Sol достиг 68,8% при максимальных усилиях. OpenAI подчеркнула, что этот результат был всего на 1,1 процентный пункт ниже максимального балла Claude Fable 5, который составил 69,9%, но при этом с затратами на задачу примерно на 80% ниже.

GPT-6 Luna также показал производительность в 66,6% в этом же тесте, как сообщила компания. Такие функции были внедрены и в Codex, платформу OpenAI, ориентированную на задачи кодирования, что позволяет разработчикам выполнять больше задач по кодированию и использовать ИИ-агентов благодаря снижению затрат.

OpenAI также продемонстрировала результаты GPT-6 Sol в профессиональных задачах, связанных с использованием нескольких инструментов и приложений. В AutomationBench, который оценивает агентов в рабочих процессах, охватывающих продажи, маркетинг, операции, поддержку, финансы и человеческие ресурсы, Sol достиг 33,2% при максимальных усилиях. Этот показатель превзошел Claude Opus 5, который показал 26,9% в тесте, по данным компании, а предполагаемая стоимость одной задачи для Sol также была значительно ниже.

Кроме того, в тесте под названием Agents’ Last Exam GPT-6 Sol достиг 56,4% при максимальных усилиях. OpenAI заявила, что этот результат превысил самый высокий балл, зарегистрированный Claude Opus 5 в этой оценке, который составил 60%, но при этом с затратами на операцию на 60% меньше.

Взаимодействие с компьютерами

Работа с компьютерами — еще одна область, в которой OpenAI отметила достижения. В офлайн-тесте OSWorld 2.0 GPT-6 Sol, используя дополнительные усилия, набрал 60,5%, в отличие от 60,3% Claude Opus 5 при среднем усилии. OpenAI заявила, что это достижение было получено при стоимости задачи примерно на 80% ниже.

Со своей стороны, GPT-6 Luna продемонстрировал превосходство над GPT-5.6 Sol при среднем усилии в том же типе оценки, при этом стоимость составляла примерно десятую часть от стоимости за задачу.

Несмотря на представленные улучшения, OpenAI сохранила GPT-6 Astra в качестве своей эталонной модели для задач, связанных с работой с компьютерами.

Помимо технических улучшений, Sol и Luna включают изменения в стиле общения, установленном в GPT-6 Astra. OpenAI прогнозирует, что новые модели будут предоставлять более четкие ответы, уменьшая жаргон, необычные конструкции и детали, считающиеся малозначимыми. Ожидается также несколько более краткие ответы без ущерба для содержания.

Это изменение должно быть особенно заметным в технических диалогах и тех, которые связаны с программированием. Выпуск Sol и Luna ускоряет расширение семейства GPT-6. Первая модель этого поколения, GPT-6 Astra, была выпущена в начале сентября и сосредоточена на таких функциях, как программирование, научные исследования, работа с компьютерами, кибербезопасность и профессиональная работа.

С этими моделями OpenAI теперь предлагает варианты с различными комбинациями возможностей и стоимости. В то время как Astra остается флагманской, Sol и Luna направлены на демократизацию части ресурсов нового поколения для задач, требующих большого объема обработки.

Внедрение этих двух моделей также укрепляет стратегию компании по снижению операционных затрат агентов и приложений ИИ, особенно в сценариях, где системы должны выполнять множество последовательных операций. Sol и Luna уже доступны через OpenAI в их продуктах и API, расширяя доступ к новому поколению моделей.

Похожие сюжеты

SenseTime выпустила SenseNova U1.5: модель с 8 млрд параметров для унифицированного зрения с открытым кодом обучения
Подробнее
pandaily.com

SenseTime выпустила SenseNova U1.5: модель с 8 млрд параметров для унифицированного зрения с открытым кодом обучения

Компания SenseTime представила SenseNova U1.5 — модель с восемью миллиардами параметров, которая объединяет понимание, рассуждение и генерацию в пространстве пикселей в единую нативную мультимодальную систему.

В отличие от существующих конвейеров, которые используют кодировщик зрения для восприятия и отдельный вариационный автокодировщик для синтеза, U1.5 отображает пиксели и текст в общий каркас без этих внешних модулей. Это соответствует линии NEO-unify компании, при этом улучшена пространственная реконструкция для достижения более высокой точности при производственных разрешениях.

Архитектурное изменение заключается в замене независимого декодирования MLP патчей на легковесный пространственный декодер. Визуальные токены преобразуются в двумерное поле признаков, а затем восстанавливаются с помощью стадий Pixel Shuffle и локальных сверток, что позволяет соседним областям обмениваться информацией перед финализацией пикселей.

SenseTime сообщила, что интерфейс по-прежнему отображает каждую область размером 32 на 32 на один визуальный токен, однако он поддерживает нативную генерацию до 4K с меньшим количеством разрывов швов и текстурных неоднородностей по сравнению с предыдущей версией U1. Это стало возможным благодаря шумовому кондиционированию, учитывающему разрешение, в более широких соотношениях сторон.

Процесс после обучения следует рецепту специализации, а затем унификации. Специалисты по обучению с подкреплением фокусируются на визуальной эстетике, билингвальном рендеринге текста, макетировании инфографики и редактировании изображений. Затем многоэкспертная дистилляция по политике объединяет эти навыки в одного студента вдоль его собственных траекторий генерации.

SenseTime утверждает, что результаты U1.5 превосходят U1 в наборах данных для генерации и редактирования изображений, включая конкурентный билингвальный рендеринг текста и многореференсное редактирование, при этом сохраняя в целом высокие показатели мультимодального понимания на стандартных бенчмарках STEM, VQA и OCR.

Наряду с техническим отчетом, опубликованным на arXiv и Hugging Face Papers, SenseTime делает открытым код обучения, который охватывает контролируемую тонкую настройку, обучение с подкреплением и дистилляцию по политике. Активы модели доступны в коллекциях SenseNova и Hugging Face под организацией OpenSenseNova. Этот релиз представляет собой полный продукт U1.5, а не раннюю версию U1.5-Lite-Preview, и предназначен для разработчиков, желающих получить компактную нативную унифицированную модель зрения, которую можно исследовать, настраивать и переобучать полностью.

Популярное