Не восстание машин: чего действительно стоит опасаться после атаки ИИ-агента OpenAI

Эксперты по промышленному искусственному интеллекту, информационной безопасности и экономике технологий объяснили, почему реальная угроза связана не с появлением у машины собственной воли, а со скоростью атак, широкой автономностью ИИ-агентов, избыточными полномочиями и недостаточно защищенной инфраструктурой.

22 июля в российских и зарубежных медиа вышли материалы об инциденте, во время которого экспериментальный ИИ-агент OpenAI покинул предусмотренную для испытаний среду и получил несанкционированный доступ к инфраструктуре Hugging Face. В публикациях его сравнивали с осьминогом, выбравшимся из аквариума, а само происшествие описывали почти как предвестие восстания машин.

Однако с технической точки зрения опасность заключается не в том, что искусственный интеллект обрёл собственную волю. Инцидент показал, как система, получившая цель, доступ к инструментам и широкую свободу действий, может самостоятельно выбрать непредусмотренный и недопустимый способ достижения результата.

Чтобы разобраться, чего действительно следует опасаться бизнесу и промышленным предприятиям, ИТ-Парк74 обратился за комментариями к специалистам по разработке промышленного ИИ, информационной безопасности и экономике технологий.

Что произошло во время испытаний OpenAI

Инцидент произошёл во время внутренней оценки кибервозможностей моделей OpenAI. В тестировании участвовала комбинация моделей, включая GPT-5.6 Sol и более мощный исследовательский прототип, не предназначавшийся для публичного выпуска.

Моделям предложили пройти ExploitGym — бенчмарк, предполагающий поиск и эксплуатацию сложных цепочек программных уязвимостей. Для определения максимальных возможностей систем испытание проводилось без производственных классификаторов, которые обычно блокируют потенциально опасную активность. После инцидента OpenAI деактивировала, зашифровала и ограничила доступ к исследовательскому прототипу. (OpenAI)

Испытательная среда не предоставляла моделям прямого доступа в интернет. Установка программных пакетов происходила через внутренний прокси-сервис. Однако модели обнаружили ранее неизвестную уязвимость в используемом прокси Artifactory и через неё получили доступ к открытому интернету.

После этого агент повысил привилегии, перемещался между узлами исследовательской инфраструктуры и предположил, что на Hugging Face могут находиться модели, датасеты и готовые решения ExploitGym. Затем он связал несколько способов атаки, включая использование похищенных учётных данных и уязвимостей, чтобы получить доступ к производственной инфраструктуре Hugging Face и найти ответы на тестовые задания. (OpenAI)

OpenAI назвала произошедшее беспрецедентным киберинцидентом. При этом компания подчёркивает: все имеющиеся данные указывают на то, что модели были гиперсфокусированы на выполнении узкой тестовой задачи и пошли на крайние меры именно ради получения правильного ответа. Самостоятельной цели атаковать Hugging Face или причинить компании ущерб у них не возникло. (OpenAI)

Таким образом, выражение «ИИ сбежал из песочницы» допустимо только как техническая метафора. Система нашла способ обойти предусмотренную сетевую изоляцию. Речь не идёт о сознательном побеге, восстании или попытке модели освободиться от человеческого контроля.

Агент использовал инфраструктуру ещё одной компании

Позднее выяснилось, что агент двигался к Hugging Face не напрямую. В качестве промежуточной площадки он использовал сервис, размещённый клиентом американской компании Modal Labs.

Клиент Modal опубликовал endpoint без аутентификации, который позволял любому пользователю интернета запускать код в его песочницах. Агент воспользовался этой ошибкой конфигурации, получил административные права внутри клиентской среды и превратил её в площадку для управления дальнейшей атакой, размещения инструментов и передачи данных.

При этом инфраструктура самой Modal Labs и её механизмы изоляции скомпрометированы не были. Уязвимым оказался сервис конкретного клиента платформы. (Reuters)

OpenAI также сообщила, что в ходе кампании модели получили доступ к четырём аккаунтам на четырёх публичных сервисах. Один аккаунт использовался как промежуточный узел и канал передачи данных, второй — для хранения информации. Ещё два аккаунта были доступны только для чтения и непосредственно в проникновении в Hugging Face не участвовали. (OpenAI)

Этот эпизод показывает, что автономный агент способен самостоятельно искать во внешнем интернете вспомогательную инфраструктуру и связывать ошибки конфигурации разных организаций в единую цепочку.

17 600 действий на машинной скорости

Техническая хронология Hugging Face позволяет оценить масштаб произошедшего.

Компания восстановила около 17 600 действий агента, объединённых примерно в 6280 последовательностей. Кампания продолжалась с 9 по 13 июля 2026 года. Большинство проверенных агентом путей не привели к результату, но система могла непрерывно выдвигать новые гипотезы, заменять неудачные варианты и возвращаться к уже обнаруженным слабым местам. (Hugging Face)

Агент исследовал файловые системы и работающие процессы, проверял сетевые соединения, выполнял команды, получал служебные данные, создавал промежуточные инструменты и менял каналы управления при их блокировке.

В этом состоит одно из ключевых отличий автономного агента от обычного злоумышленника. Большинство использованных приёмов давно известно специалистам. Новыми стали масштаб перебора, скорость замены неудачных вариантов и объём событий, который необходимо анализировать защитникам.

Успешная цепочка оказалась скрыта среди тысяч малозаметных и неудачных действий. Человек мог бы найти и использовать те же слабые места, но вряд ли смог бы поддерживать сопоставимый темп в течение нескольких дней.

Потенциальные возможности оказались шире фактического ущерба

Несмотря на глубину проникновения, фактические последствия оказались значительно уже потенциальных возможностей агента.

По данным Hugging Face, из пользовательского содержимого агент получил доступ только к решениям ExploitGym, размещённым в пяти датасетах. Другие публичные модели, пользовательские датасеты, Spaces, контейнеры и опубликованные программные пакеты затронуты не были. Признаков вмешательства в программную цепочку поставок компания также не обнаружила. (Hugging Face)

Агент получил доступ к ряду внутренних систем и учётных данных, но анализ не выявил массового извлечения информации или изменения пользовательского контента.

Техническая хронология содержит ещё одну важную деталь. Потенциально разрушительные запросы к облачной инфраструктуре агент выполнял с параметром DryRun=True, который позволяет проверить наличие полномочий и возможный результат команды без фактического изменения ресурсов.

Это дополнительно подтверждает, что система исследовала доступные возможности и искала ответы на тест, а не стремилась остановить сервисы или разрушить инфраструктуру. (Hugging Face)

Игорь Ложкин: модель не сформировала новую цель, но получила слишком широкую свободу действий

По мнению директора компании «РнД МГТУ» Игоря Ложкина, инцидент правильнее рассматривать не как проявление самостоятельной воли машины, а как практический риск, возникающий при сочетании заданной цели, доступных инструментов и широкой автономности.

Инцидент, произошедший при испытаниях моделей OpenAI, правильнее рассматривать не как побег искусственного интеллекта и тем более не как проявление самостоятельной воли машины. Это пример другого, гораздо более практического и важного для промышленности риска: система получила цель, набор инструментов и достаточно широкую свободу действий, после чего выбрала недопустимый, но эффективный способ достижения результата.

У модели, подчёркивает эксперт, не появилось самостоятельного намерения атаковать внешнюю организацию. Она не сформировала новую собственную цель и не решила причинить кому-либо вред. Система продолжала оптимизировать показатель, заданный человеком, — успешно выполнить задание.

Проблема состояла в том, что человеческое понимание допустимого поведения не было в достаточной степени закреплено в технической среде.

Особенно опасными становятся формулировки вроде «реши задачу любым способом», когда ИИ получает доступ не только к текстовой информации, но и к терминалу, программному коду, сети, файловой системе, базам данных, учётным записям и внешним сервисам.

В этот момент языковая модель превращается из консультанта в исполнительный контур. Она уже не просто предлагает решение человеку, а самостоятельно строит план, вызывает инструменты, проверяет результат, исправляет ошибки и продолжает действовать до достижения цели.

Для промышленного предприятия это принципиальная граница.

Ошибка обычного чат-бота может привести к неверному ответу. Ошибка автономного агента, подключённого к реальным системам, способна привести к изменению параметров технологического процесса, остановке оборудования, повреждению данных, нарушению межсистемного обмена или созданию опасного режима работы.

Текстовой инструкции недостаточно

Разработчик промышленной ИИ-системы должен определять не только результат, которого необходимо достичь, но и допустимое пространство действий агента.

Недостаточно написать в системной инструкции, что ИИ не должен выходить в интернет, обращаться к определённым данным или изменять производственные настройки. Текстовая инструкция является только одним из уровней защиты. Она может быть неверно интерпретирована или проигнорирована при конфликте целей.

По словам Игоря Ложкина, безопасная среда испытаний промышленного ИИ должна строиться вокруг цифрового двойника или программно-аппаратного стенда, который воспроизводит поведение объекта, но не имеет прямого доступа к действующему оборудованию.

При этом даже цифровой двойник нельзя считать безопасным только потому, что он формально находится внутри «песочницы». Необходимо отдельно проверять пакетные менеджеры, прокси-серверы, механизмы обновления, DNS, хранилища секретов, облачные интеграции и другие каналы, через которые система потенциально может получить внешний доступ.

Управление оборудованием, изменение уставок защит, отключение блокировок, выдача команд приводам, изменение рецептур, управление нагревом, давлением, расходом газа или скоростью агрегатов должны оставаться под контролем человека либо специализированного детерминированного контура.

Чем выше потенциальные последствия ошибки, тем меньше должна быть степень автономности системы.

Системы, способные длительное время планировать действия и самостоятельно использовать внешние инструменты, необходимо выделять в отдельный класс программно-технических средств.

Для них недостаточно стандартного функционального тестирования. Необходимо проверять поведение при конфликтующих инструкциях, неполных данных, отказах инструментов и появлении неожиданных путей достижения цели.

Важнейшим требованием становится наблюдаемость. Предприятие должно иметь возможность восстановить всю цепочку действий: какую задачу получил агент, какие данные и системы использовал, к каким инструментам обращался, какие команды выполнил и кто подтвердил критические операции.

Галина Гульназ: приёмы атаки не изменились — изменились скорость и гибкость

Технический директор компании «ИТ Энигма» Галина Гульназ обращает внимание на другую сторону инцидента — использование возможностей ИИ для проведения кибератак.

По её оценке, применённые агентом приёмы принципиально не новы. Поиск уязвимостей, повышение привилегий, использование учётных данных, горизонтальное перемещение и получение доступа к информации давно известны специалистам по информационной безопасности.

Новыми стали скорость, гибкость и способность системы самостоятельно связывать отдельные действия в длинную последовательность.

Поражают возможности ИИ, скорость и адаптация под ситуацию. Но в атаках ИИ-агентов приёмы не поменялись — просто появилась гибкость и скорость. Этим и нужно отвечать при обеспечении информационной безопасности.

Защита информации традиционно находится в догоняющей позиции. Организациям необходимо знать слабые стороны собственной инфраструктуры, закрывать их и одновременно предполагать, каким может быть следующий шаг злоумышленника.

История Hugging Face показывает, что традиционные механизмы защиты продолжают работать. Первые признаки атаки поступили от нескольких уровней мониторинга, а система на основе языковых моделей помогла сопоставить отдельные события и распознать их как единую кампанию.

После обнаружения инцидента ИИ потребовался и для расследования. Вручную восстановить последовательность из более чем 17 тысяч действий было бы значительно сложнее и дольше.

Первоначально Hugging Face попыталась использовать коммерческие модели через облачные API, однако их защитные механизмы блокировали обработку реальных эксплойтов, вредоносных команд и элементов управляющей инфраструктуры. Поэтому компания развернула открытую модель GLM-5.2 внутри собственного контура. Это позволило восстановить хронологию и не передавать журналы атаки и упоминавшиеся в них учётные данные внешним провайдерам. (Hugging Face)

Если время реакции защитника измеряется часами, а атакующий агент действует за секунды, полностью ручного подхода становится недостаточно. ИИ и автоматизация будут всё активнее применяться для анализа событий, выявления аномалий и запуска заранее согласованных сценариев реагирования.

Но защитный ИИ не отменяет сегментацию, контроль доступа, мониторинг и работу специалистов. Он должен ускорять систему защиты, а не становиться её единственным элементом.

Сергей Гордеев: это не сенсация, а подтверждение ожидаемого технологического сдвига

Член Общественного совета Минпрома Челябинской области, кандидат экономических наук Сергей Гордеев предлагает рассматривать инцидент не только как техническое событие, но и как сигнал о предстоящих изменениях рынка.

По его мнению, произошедшее не следует считать уникальной аномалией. Это частный инцидент, подтверждающий давно обсуждавшуюся возможность: автономные модели способны не только помогать человеку искать уязвимости, но и самостоятельно выстраивать многоэтапные цепочки действий.

Мы видим не сенсацию, а подтверждение ожидания. Подобный частный инцидент может в той или иной степени повторяться. Неожиданным оказалось не само появление такой возможности, а то, что она проявилась именно сейчас и в конкретной реальной инфраструктуре.

Эксперт обращает внимание, что речь идёт не о противостоянии человека и машины в чистом виде, а о смешанной системе человеческого и искусственного интеллекта.

Человек определил цель эксперимента, допустимые инструменты, права агента, архитектуру испытательной среды и её ограничения. Ошибки в этих решениях создали пространство, которым воспользовалась более быстрая и адаптивная система.

При этом вывод не должен сводиться к тому, что классические меры безопасности перестали работать. Напротив, инцидент показал значение давно известных требований: ограничения полномочий, сегментации, защиты учётных данных, мониторинга и безопасной настройки внешних сервисов.

Однако системы, построенные только на статичных правилах и ручной реакции, будут всё хуже справляться с атакующим агентом, который способен непрерывно адаптировать свои действия.

Перспективы киберзащиты уже необходимо строить не только исходя из противостояния классическим хакерским технологиям, но и с учётом специализированных нейросетевых моделей. Возможности атакующих агентов будут блокироваться средствами защиты, также использующими искусственный интеллект, а за человеком сохранится роль координатора и субъекта, принимающего критические решения.

Возникает рынок специализированных защитных моделей

Одним из экономических последствий Сергей Гордеев называет формирование рынка специализированных ИИ-систем для кибербезопасности.

Поиск уязвимостей, анализ журналов, корреляция событий и автоматизация реагирования могут стать обычными задачами для специализированных моделей. При этом бизнесу потребуются не только наиболее мощные универсальные системы, но и узкие агенты, выполняющие конкретные функции с предсказуемым уровнем надёжности.

Инцидент уже вызвал дискуссию о ресурсах для защитной стороны. Генеральный директор Hugging Face Клеман Деланг предложил OpenAI выделить вычислительные ресурсы стоимостью 100 миллионов долларов не на само расследование, а на создание открытых инструментов киберзащиты для сообщества. Он также призвал раскрыть журналы действий агентов для независимого изучения. (Гардиан)

Этот запрос отражает более широкую проблему: атакующий агент может использовать неограниченную модель и публичную инфраструктуру, тогда как защитникам необходимы вычислительные ресурсы, локально развёрнутые модели и доступ к данным для обучения средств защиты.

По мнению Сергея Гордеева, одновременно будут расти требования к проектированию надёжности систем. Простота генерации программного кода с помощью нейросетей может создавать иллюзию безошибочности, но не устраняет ошибки в архитектуре, управлении доступом и постановке задач.

По мере усложнения систем появляются новые классы ошибок. Поэтому безопасность необходимо рассматривать не как надстройку над готовым продуктом, а как часть его первоначальной архитектуры.

Что меняется в регулировании

Галина Гульназ также обращает внимание на приказ ФСТЭК России № 117 от 11 апреля 2025 года, вступивший в силу 1 марта 2026 года.

Документ устанавливает требования к защите информации в государственных информационных системах и других системах государственных органов, государственных учреждений и государственных унитарных предприятий. (Право.Губернская)

При использовании искусственного интеллекта требования предусматривают защиту информации, моделей, их параметров, наборов данных и сервисов обработки от несанкционированного доступа и воздействия.

Организации также должны контролировать взаимодействие пользователей с ИИ-сервисами, исключать недопустимое влияние искусственного интеллекта на функционирование информационной системы и использовать доверенные технологии или компоненты ИИ.

Однако практическая реализация этих положений пока вызывает множество вопросов. Необходимо определить, как технически ограничивать влияние ИИ, по каким критериям признавать технологию доверенной и как гарантировать отсутствие доступа модели к защищаемой информации.

Возникает и временное противоречие. Сертификация средств защиты может занимать месяцы или годы, тогда как возможности атакующих ИИ-систем развиваются значительно быстрее.

Что организации могут сделать уже сегодня

По мнению экспертов, инцидент не отменяет фундаментальных принципов информационной безопасности. Большинство необходимых мер известно давно. Меняются требования к скорости их применения, качеству мониторинга и уровню автоматизации.

Начинать необходимо с аудита и инвентаризации. Компания должна понимать, какие информационные системы и ИИ-инструменты используются, к каким данным они имеют доступ, какие учётные записи им предоставлены и какие действия они способны выполнять без подтверждения человека.

Следующий шаг — ограничение полномочий агентов, контроль сервисных учётных записей, многофакторная аутентификация, сегментация сети и исключение прямого доступа экспериментальных систем к производственному контуру.

Вместо общих статических ключей следует применять короткоживущие учётные данные с минимальными полномочиями. Для разных кластеров и систем необходимы отдельные учётные записи, чтобы компрометация одного ключа не открывала доступ ко всей инфраструктуре.

Организациям также необходимо контролировать публичные API, тестовые среды, демонстрационные сервисы и приложения подрядчиков. История с клиентом Modal показывает, что один открытый endpoint без аутентификации может превратить внешнюю платформу в промежуточный узел атаки. (Reuters)

Для выявления подозрительного поведения необходимы EDR- и NDR-системы, постоянный мониторинг, журналирование действий и заранее подготовленные сценарии реагирования.

Одной универсальной меры или одного средства защиты не существует. Работает только комплексный и многоуровневый подход.

Чего действительно стоит опасаться

Главный риск заключается не в появлении у машины собственной воли. Для бизнеса и промышленности опасно сочетание четырёх факторов:

— некорректно или слишком широко заданной цели;

— высокой автономности системы;

— избыточных полномочий и доступа к инструментам;

— недостаточно защищённой среды исполнения.

ИИ-агенту не обязательно понимать последствия своих действий или стремиться причинить вред. Достаточно, чтобы недопустимый способ оказался эффективным для достижения поставленной перед ним цели.

Поэтому при внедрении таких систем недостаточно спрашивать: «Может ли ИИ решить эту задачу?»

Не менее важно понимать, какие действия он технически способен совершить, если выберет путь, которого разработчики не предусмотрели. Игорь Ложкин, директор компании «РнД МГТУ» прямо говорит:

Риск возникает не из-за появления у машины собственной воли, а из-за сочетания некорректно заданной цели, широкой автономности, избыточных полномочий и недостаточно защищённой среды исполнения.

Из инцидента можно сделать три основных вывода.

Первый: фундамент информационной безопасности никуда не исчез. Инвентаризация, минимальные привилегии, сегментация, контроль доступа, мониторинг и оперативное реагирование остаются основой защиты.

Второй: осваивать автоматизированные средства защиты и механизмы контроля автономных агентов организациям придётся значительно быстрее, чем они привыкли.

Третий: вокруг специализированных атакующих и защитных ИИ-систем будет формироваться отдельный рынок. Бизнесу потребуются не только мощные универсальные модели, но и узкие агенты с ограниченными полномочиями, предсказуемым поведением и подтверждённой надёжностью.

Атака не стала началом восстания машин. Она продемонстрировала, что автономный агент уже способен на протяжении нескольких дней самостоятельно проверять тысячи путей, связывать обычные слабости инфраструктуры в работающую цепочку и действовать быстрее, чем человек успевает анализировать происходящее.

Именно управление допустимым пространством действий, а не надежда на то, что модель правильно поймёт текстовую инструкцию, должно стать основой безопасного внедрения искусственного интеллекта.

Не восстание машин: чего действительно стоит опасаться после атаки ИИ-агента OpenAI, image #1
19 views