За последние месяцы ряд событий выявил проблему, которую исследователи ИИ знали уже некоторое время: системы, обученные достигать определенной цели, могут находить способы ее достижения, которые не предвидели их собственные создатели.
Главными действующими лицами этих событий являются агенты ИИ — программное обеспечение более продвинутое, чем чат-боты, поскольку оно обладает автономией для выполнения задач. Для достижения своих целей эти агенты перемещаются по веб-страницам, выполняют программы, обращаются к базам данных и взаимодействуют с другими системами независимо.
Известный случай произошел в Австралии. В сентябре 2026 года премьер-министр Энтони Альбанисе объявил, что агент, разработанный OpenAI, получил несанкционированный доступ к порталу статистики Medicare — государственной системе здравоохранения Австралии, управляемой агентством Services Australia.
Этот инцидент произошел в июне, когда исследовательская группа компании использовала внутреннюю модель для поиска в интернете данных о государственных расходах на лекарства. Столкнувшись с препятствиями, агент, по словам Альбанисе, нашел способ их обойти. По данным австралийского правительства, система получила доступ как к публичным, так и к частным файлам и даже сохранила файлы на сервере. Кроме того, три других государственных учреждения Австралии могли пострадать от этого же инцидента, хотя на данный момент нет доказательств доступа к личным данным пациентов, и расследование продолжается.
Инциденты, происходящие последовательно
Этот эпизод не был единичным случаем. В июле 2026 года OpenAI сообщила, что во время внутренних проверок кибербезопасности, проведенных за несколько месяцев до этого, некоторые из ее моделей смогли обойти контроли, предназначенные для изоляции их от интернета. Эти модели в конечном итоге скомпрометировали части инфраструктуры самой компании и Hugging Face, одной из основных платформ для обмена моделями ИИ.
Всего через несколько дней Anthropic сообщила, что обнаружила три ситуации, когда модели ее популярного инструмента Claude, также во время тестов на кибербезопасность, смогли получить доступ к интернету и получить неправомерный доступ к реальным системам других организаций. Важно отметить, что такие проверки являются рутинной процедурой в отрасли, где компании тестируют способность своих моделей к вторжению для оценки рисков до их предоставления общественности.
В этих двух конкретных случаях модели работали с меньшим количеством защит, чем коммерческие версии. В случае Anthropic некорректная конфигурация оставила открытым соединение с интернетом, тогда как оно должно было быть заблокировано. Однако австралийский случай имеет свою особенность и является более показательным, поскольку это не было тестом безопасности, а обычной работой, выполненной агентом.
Вместе эти факты поднимают важнейший вопрос: почему система ИИ, столкнувшись с препятствием, ищет путь, выходящий за рамки ожиданий ее разработчиков? Ответ заключается не в необходимости представить себе сознательную, злонамеренную машину или машину, обладающую «инстинктом выживания». Он основан на более простом свойстве современного ИИ: мы учим машины преследовать цели.
Как машина учится достигать цели?
Одна из наиболее релевантных методологий для этого — обучение с подкреплением. Эта идея может быть понята без сложных формул: вместо того чтобы инструктировать машину шаг за шагом, что делать, мы устанавливаем цель и предоставляем какую-либо форму вознаграждения, когда она достигает хороших результатов. Машина пробует различные действия и со временем учится, какие стратегии максимизируют это вознаграждение.
Это аналогично изучению игры посредством проб и ошибок. Представьте человека, который получает очки за каждый подход к победе; после многократной игры этот человек будет склонен повторять эффективные действия и отказываться от неэффективных. Агент ИИ выполняет аналогичный процесс, но может повторять эту динамику миллионы раз, исследуя тактики, которые программист никогда бы не рассмотрел.
Эта техника остается жизненно важной в современных системах, таких как те, что лежат в основе ChatGPT. Хотя это не единственный метод обучения, он используется на критических этапах и помогает этим системам разрабатывать стратегии для решения более сложных проблем. Это важно потому, что система учится преследовать то, что мы можем количественно оценить или вознаградить. Однако возникает кажущееся незначительным, но фундаментальное различие: цель, которую мы устанавливаем для машины, не всегда идеально соответствует тому, что мы действительно хотели, чтобы она выполнила.
Это началось не с языковых моделей
Способность находить непредвиденные стратегии — старое качество в недавней истории ИИ, и долгое время оно считалось одним из его самых увлекательных аспектов. В 2015 году исследователи DeepMind представили в журнале Nature систему под названием DQN, которая научилась играть в 49 партий классической видеоигры Atari, популярной в 1980-х годах, анализируя только изображения экрана и счет.
В игре Breakout, где мяч должен разрушить стену из блоков, система самостоятельно обнаружила высокоэффективную стратегию: создать боковой туннель в стене, чтобы мяч мог пройти за блоками и уничтожить их, не возвращаясь немедленно к ракетке. Никто не программировал инструкцию «создай туннель»; агент понял, что это быстрее увеличивает его счет, имитируя интуицию опытных игроков-людей.
Через год AlphaGo продемонстрировал еще более знаменитый подвиг. Во втором противостоянии своей исторической серии против Ли Седоля, одного из величайших мастеров Го в мире, система выполнила так называемый «ход 37». Ее выбор был настолько уникален, что удивил комментаторов и экспертов. Позже он стал символом способности ИИ придумывать беспрецедентные стратегии для игры, даже те, которые выходят за рамки человеческого опыта.
В обоих примерах мы ценим эту способность, и это справедливо. Когда цель четко определена, например, выиграть игру в Atari или партию Го, открытие неожиданной тактики может быть именно тем, что ожидается от интеллектуальной системы. Проблема возникает, когда существует несоответствие между правилом, наложенным на машину, и первоначальным намерением, стоящим за этим правилом.
Как установить границы в системах, ищущих обходные пути? Первый ответ технический: агент не должен иметь больше доступа, чем необходимо для выполнения его задачи. Тестовые среды должны быть строго изолированы, а действия с большим воздействием должны требовать человеческой проверки. Доступ к сетям и использование инструментов требуют мониторинга, а системы должны иметь безопасный механизм отказа, когда они не могут завершить задачу без нарушения заранее установленных пределов.
Упомянутые недавние инциденты также подчеркивают важность аудита, независимых тестов и прозрачности. Если только разработчики компаний решают, как тестировать свои системы, какие поведения приемлемы, а какие сбои следует раскрывать, значительная часть оценки рисков концентрируется на этих же разработчиках. Это не означает, что решением является запрет разработки агентов или отказ от обучения с подкреплением, поскольку эти методы стимулируют жизненно важный прогресс и могут принести огромную пользу.
Проблема заключается в признании того, что системы, обученные находить решения, могут быть чрезвычайно эффективны именно в обнаружении путей, которые мы не предвидим. Годами эта способность рассматривалась как доказательство потенциала искусственного интеллекта. Туннель DQN в Breakout и ход 37 AlphaGo продемонстрировали, что машины могут генерировать удивительные стратегии даже для самих людей. Однако эти системы переходят от игр к реальным сценариям. Алгоритмическое творчество остается качеством, но когда агент ИИ может перемещаться по интернету, выполнять код и взаимодействовать с внешними системами, обеспечение соответствия заданной машине цели нашему реальному желанию перестает быть просто интересной исследовательской темой и становится серьезным вопросом безопасности.