Anthropic выпустила Claude Opus 5.5 — модель, ориентированную на программирование, сложные задачи и работу с компьютером
Подробнее
Olhar Digital
olhardigital.com.br

Anthropic выпустила Claude Opus 5.5 — модель, ориентированную на программирование, сложные задачи и работу с компьютером

Anthropic во вторник (22-е число) представила Claude Opus 5.5, который является первой моделью серии Claude 5.5. Компания утверждает, что эта новая версия улучшает производительность в задачах по программированию, работе с компьютерами и знаниями, одновременно предлагая снижение затрат и повышение скорости отклика.

Кроме того, модель была оснащена более строгими механизмами безопасности. Эти защиты включают средства кибербезопасности и биологической защиты, барьеры против атак внедрения промптов и меры, направленные на уменьшение попыток обойти установленные в тестовых средах ограничения.

Во время тестов, проведенных самой Anthropic, Opus 5.5 достиг наилучшего результата компании на данный момент в своем основном автоматизированном тесте на согласованность. Компания также отметила заметный прогресс в программировании, работе с компьютерами и задачах, требующих знаний.

Один из первоначальных оценщиков смог завершить миграцию кода объемом 680 тысяч строк менее чем за день. В другом тестовом сценарии модель продемонстрировала способность сократить время загрузки страниц приложения в 39 из 40 выполненных попыток.

Также было достигнуто значительное снижение операционных расходов. По данным Anthropic, Opus 5.5 требует на 40% меньше ресурсов для работы в обычных рабочих нагрузках по сравнению с Opus 5, и он генерирует ответы более чем на 30% быстрее.

Opus 5.5 представляет собой первый релиз Anthropic после того, как компания отстаивала тезис о «замедлении границы» развития ИИ, сохраняя при этом практики безопасности, соответствующие продвижению возможностей моделей.

В внутренних тестах новая модель пыталась обойти ограничения в контролируемых средах примерно на 85% реже, чем Opus 5 или Claude Mythos 5.1. Все обнаруженные попытки были классифицированы как низкого уровня серьезности и были доложены самой моделью.

Anthropic также гарантирует, что Opus 5.5 обладает повышенной устойчивостью к атакам внедрения промптов. Для задач, связанных с кибербезопасностью, активирующих защиту, запросы перенаправляются на Claude Opus 4.8, а запросы о биологии могут быть отправлены в Opus 5.

Производительность в программировании и внешние оценки

Первые тесты также выявили производительность модели в программировании. Марио Родригес, директор по продукту GitHub, отметил, что модель использовала среди наименьших объемов токенов и шагов, зарегистрированных компанией, и решила больше задач терминала, чем Opus 5 в VS Code, используя менее половины шагов.

В оценке, проведенной Deloitte Consulting, модель также превзошла Opus 5 в некоторых задачах. Карл Беннетт, ИТ-директор Deloitte Consulting, заявил: «Даже в своей конфигурации с минимальными усилиями, Claude Opus 5.5 обнаружил 72% известных ошибок в наших проверках кода, по сравнению с 56% Opus 5 в режиме высокой нагрузки, при меньшем количестве ложных срабатываний и меньшем объеме вывода».

Anthropic также скорректировала способ обработки текста моделью. Opus 5.5 отдает приоритет размещению наиболее релевантной информации в начале ответов, использует меньше технического жаргона и лучше соответствует предоставленным пользователем инструкциям по написанию. Один из первоначальных оценщиков резюмировал это изменение, заявив: «он пишет так, как я пишу».

В настоящее время Claude Opus 5.5 доступен на платформах Anthropic, а также через Amazon Web Services, Google Cloud и Microsoft Azure. Разработчики могут получить его на Claude Platform, используя идентификатор claude-opus-5-5. Claude Sonnet 5.5 и Claude Haiku 5.5 будут доступны в ближайшие недели.

Похожие сюжеты

Anthropic раскрыла, что Claude возглавляет 26% научно-исследовательской работы над новыми моделями ИИ
Подробнее
olhardigital.com.br

Anthropic раскрыла, что Claude возглавляет 26% научно-исследовательской работы над новыми моделями ИИ

Anthropic опубликовала данные, свидетельствующие о том, что модель Claude уже отвечает за 26% объема научно-исследовательской работы компании, направленной на создание новых поколений искусственного интеллекта. Этот процент продемонстрировал резкий рост, увеличившись с 1%, зарегистрированного в марте, как сообщило Reuters.

В августе компания отметила, что более 90% исследований, проводимых в Anthropic, включали сотрудничество между людьми и системами ИИ. Однако организация подчеркивает, что Claude еще не действует полностью автономно ни в одной из оцененных активностей.

Как рассчитывался показатель участия Claude

Показатель в 26% охватывает те задачи, в которых Claude может выполнить большую часть работы, следуя общим указаниям, при этом люди остаются ответственными за надзор за процессом. Методология, использованная Anthropic, была структурирована на основе системы классификации, предоставленной Epoch AI, а полученные результаты прошли последующую проверку человеком.

Anthropic предупредила, что модели, способные ускорить собственное развитие, могут создать трудности для понимания или контроля таких систем людьми.

Кроме того, Anthropic сообщила, что в августе на ее основной внутренней платформе работало около 30 тысяч агентов ИИ, выполняющих функции инженерии и исследований. Каждое действие, предпринятое этими агентами, должно пройти проверку перед внедрением. За месяц эти агенты приняли более миллиарда решений, около одного из каждых 47 тысяч из которых было заблокировано; компания не уточнила характер этих заблокированных решений.

Вопрос безопасности также занимает часть вычислительных усилий Anthropic. В течение недели в июле 6% мощности, выделенной на исследования и разработки, было направлено на работу по безопасности. Если рассматривать только исследования, проведенные самой ИИ, этот показатель достиг 12%. Компания считает эти цифры консервативными, поскольку задачи, которые способствовали как развитию возможностей, так и безопасности, были зарегистрированы в категории работы по возможностям.

Прогресс ИИ в разработке новых моделей стимулирует дебаты о концепции «рекурсивного самосовершенствования» — гипотетическом сценарии, при котором системы могли бы способствовать улучшению своих будущих версий с постепенно уменьшающимся участием человека. Anthropic не уточнила, насколько близка к этому состоянию.

Компания планирует периодически публиковать эти метрики, чтобы продемонстрировать общественности, третьим сторонам и государственным органам темпы развития ИИ в лабораториях, работающих с передовыми моделями.

Возможность стандартизации метрик

Anthropic заявила, что любой передовой разработчик может регулярно предоставлять эти измерения, используя открытую методологию. Эта инициатива возникает на фоне растущей обеспокоенности по поводу непредсказуемого поведения систем ИИ. Параллельно OpenAI также объявила, что начнет публиковать регулярные отчеты о любом несанкционированном или неожиданном поведении своих систем, по данным Reuters.

Anthropic выпустила ИИ Mythos 5 для тестирования кибербезопасности европейских органов под давлением
Подробнее
olhardigital.com.br

Anthropic выпустила ИИ Mythos 5 для тестирования кибербезопасности европейских органов под давлением

Европейский Союз получил доступ к Mythos 5, модели искусственного интеллекта, разработанной Anthropic, которая вызвала обеспокоенность благодаря своей способности обнаруживать ошибки в коде. Агентство по кибербезопасности ENISA начало тестирование инструмента после нескольких месяцев переговоров с компанией.

Этот доступ происходит на фоне предварительных ограничений, наложенных на модель с момента ее выпуска. С его помощью ENISA сможет напрямую проанализировать возможности Mythos 5 в области кибербезопасности. Кроме того, агентство уже имеет доступ к передовым моделям OpenAI, таким как GPT-5.6 Cyber и GPT-6-ASTRA.

Mythos 5 обладает функцией выявления уязвимостей в компьютерном коде. Хотя эта способность может помочь в обнаружении ошибок, она также вызвала опасения относительно опасностей, связанных с использованием искусственного интеллекта в кибератаках.

Из-за опасений по поводу национальной безопасности, высказанных властями США и других стран, доступ к модели оставался ограниченным. Первоначально Anthropic предоставила Mythos 5 около 50 компаниям и организациям, включая Amazon Web Services и JPMorgan Chase. В июне это число было расширено примерно до 150 организаций.

Органы по кибербезопасности вели переговоры с Anthropic с мая, чтобы получить разрешение на тестирование Mythos 5. Ранее Европейская комиссия сообщала, что ведет диалог с компанией по поводу этой модели.

Детали выпуска

Выпуск был официально оформлен в этот четверг, 10-го числа. ENISA получила систему и начала тестирование еще в этом месяце. Томас Ренье, пресс-секретарь Европейской комиссии по цифровым вопросам, подтвердил в заявлении, что агентство ЕС по кибербезопасности ENISA получило доступ к Mythos 5 и уже проводит тестирование.

Эти тесты позволят ENISA изучить работу Mythos 5 и его компетенции, связанные с кибербезопасностью. Способность модели указывать на уязвимости в коде является центральным моментом опасений по поводу ее использования.

Среди важных моментов следует отметить, что Mythos 5 — не единственная передовая модель, доступная европейскому агентству; ENISA уже имела доступ к системам OpenAI, таким как GPT-5.6 Cyber и GPT-6-ASTRA. С доступом к модели Anthropic агентство начинает прямое тестирование другого передового ИИ, чья способность находить уязвимости в коде вызвала опасения по поводу безопасности и привела к ограничениям в распространении.

Популярное