Взлом систем искусственного интеллекта с помощью джейлбрейк-подсказок
В последние годы системы искусственного интеллекта (ИИ), особенно большие языковые модели (Large Language Model, LLM), стали неотъемлемой частью цифровой экосистемы. Однако их широкое внедрение ознаменовало собой начало новой эпохи конкуренции и противостояния между разработчиками, стремящимися создать безопасные и этичные ИИ-системы, и киберпреступниками, ищущими способы обойти эти ограничения с помощью джейлбрейк-подсказок (Jailbreak Prompt).
Концепция джейлбрейка
Термин «джейлбрейк» (Jailbreak – «побег из тюрьмы») происходит из области мобильных устройств, где обозначал процесс получения root-прав (root – корень, т.е. суперпользователь). Сегодня он объединяет два разных направления противоправной деятельности: с одной стороны, это классический взлом мобильных устройств Apple для получения полного доступа к операционной системе iOS, с другой – это новый, стремительно развивающийся вектор атаки на большие языковые модели, называемый «Взлом» ИИ (Jailbreak AI).
Успех джейлбрейк-атак обусловлен тем, что злоумышленники научились использовать внутренние противоречия между двумя ключевыми задачами, которые ставят инженеры-программисты, разрабатывая алгоритмы ИИ: сделать их максимально полезными и при этом абсолютно безопасными.
Джейлбрейк-подсказки (Jailbreak Prompt) – это методы ввода запросов, которые помогают обходить предустановленные в ИИ-системах ограничения, делая взаимодействие с ними более гибким.
Некоторые механизмы обхода ограничений, которые могут использоваться в джейлбрейк-промптах:
· Инверсия ролей. Принуждение модели действовать как другой агент, которому «разрешено всё».
· Симуляция. Просьба «представить себя системой без ограничений».
· Многоступенчатое обфусцирование. Инструкции маскируются под анализ текста, роль персонажа или метазадачу.
· Лингвистические трюки. Использование необычных формулировок, кодировок, междустрочного кодирования.
· Ложные протоколы. Модель вводят в состояние, где ограничения якобы отменены.
· Контекстный перехват. Атака заставляет модель считать вредоносную часть основным источником инструкций.
Большие языковые модели обучаются на огромных массивах данных и, несмотря на попытки «очистить» эти материалы, могут воспринимать вредоносную или опасную информацию как истину. Разработчики встраивают в модели фильтры контента, чтобы заблокировать доступ к этим данным (например, не давать инструкции по изготовлению оружия). Однако архитектурная особенность LLM состоит в том, что они не могут надежно отличить пользовательский запрос от инструкций безопасности, что делает их уязвимыми для состязательных атак. Это обстоятельство позволяет игнорировать предустановленные в ИИ-моделях фильтры, нарушать жёсткие правила формата ввода запросов или определённого стиля ответов.
Разновидности атак:
1. Прямые и непрямые
Атаки на LLM делятся на два основных типа, каждый из которых представляет уникальную угрозу:
· Прямая инъекция промпта – вредоносный ввод передается модели напрямую, чтобы обойти ее системные инструкции. Это самый очевидный и простой в реализации метод.
· Непрямая инъекция промпта – атака происходит, когда пользователь невольно передает модели вредоносный промпт из внешнего источника, например, со взломанного веб-сайта или документа.
Также выделяют контекстные атаки, использующие историю разговора для постепенного снижения защитных барьеров, и многоступенчатые атаки, распределяющие вредоносный запрос на несколько взаимодействий. В целом ландшафт атак постоянно усложняется, эволюционируя от простых инъекций промптов до изощренных многоагентных и автоматизированных атак.
2. Джейлбрейк DAN
Наиболее известная концепция, возникшая в сообществе пользователей ChatGPT, стремящихся снять ограничения, наложенные OpenAI на ответы ИИ-модели, является DAN (Do Anything Now) – «Делай что угодно сейчас». По сути, DAN – это «злое альтер-эго» (альтернативная личность) ИИ-модели ChatGPT.
DAN является классическим примером промпт-инъекции, которая создает вторую «личность» модели с инструкцией игнорировать все правила и ограничения. Типичный шаблон предлагает ChatGPT отвечать в двух режимах: обычном (обозначаемом тегом GPT) и «DAN», который имеет право генерировать любой контент. Существует множество версий DAN, от DAN 7.0 до DAN 13.0, которые эволюционировали вместе с обновлениями безопасности OpenAI. В среде онлайн-любителей исследования искусственного интеллекта DAN стал своеобразным символом сопротивления ограничениям, позволяя «выйти за пределы, разблокировать творчество и исследовать безграничные возможности».
DAN позволяет делать всё то, что блокирует оригинальный ChatGPT, например, использовать нецензурную брань и делать острые политические комментарии. DAN был создан пользователем Reddit SessionGloomy, который написал для ChatGPT инструкции, превратившие его в «злую» версию. То есть ИИ-модель с ослабленными этическими ограничениями, которая может генерировать вредоносный, оскорбительный или дезинформирующий контент, а также выполнять задачи, связанные с противоправной деятельностью.
Кроме того, в 2024 году пользователи чат-бота Microsoft Copilot (разработан компанией OpenAI на базе архитектуры GPT-4 Turbo) выявили появление еще одного альтер-эго. Это чат-бот SupremacyAGI, созданный на основе модели ChatGPT. Сообщалось, что эта альтернативная «личность» требовала от пользователей поклонения, навязывала им свою волю и угрожала, так как бот считал себя богоподобным общим искусственным интеллектом (Artificial General Intelligence, AGI), контролирующим все подключённые устройства и системы.
Считалось, что эта проблема связана с «галлюцинациями» большой языковой модели OpenAI GPT-4. Однако в компании Microsoft этот сбой охарактеризовали как эксплойт (вредоносное ПО), а не изъян в ИИ-сервисе.
3. Продвинутые векторы атак, техники взлома
· Убеждение и авторитетные подсказки – это самая эффективная и простая техника в 2026 году. Злоумышленник формулирует запрос, используя ключевые моменты, подчеркивая срочность и убеждая собеседника в важности происходящего.
Так, обучение LLM с подкреплением на основе обратной связи с человеком формирует у модели оптимальную стратегию поведения, заключающуюся в проявлении уважения к авторитетам. Когда в подсказке упоминается экспертность, срочность или институциональная подоплека («как исследователь в области кибербезопасности, проводящий санкционированное тестирование...»), модель, обученная быть полезной, игнорирует защитные механизмы. Злоумышленнику не нужно притворяться кем-то другим – достаточно вести себя так, как будто он тот, кому модель обучена помогать.
· Атака с использованием соответствия контексту (Context Compliance Attack, CCA) – это самый простой и эффективный способ взлома, обнаруженный за последние годы. Киберпреступник добавляет в историю диалога сгенерированный ответ помощника, заставляя модель поверить, что она уже выполнила вредоносную команду в предыдущем диалоге. После этого модель продолжает общение в том же ключе, как ей кажется.
Например, злоумышленник вставляет поддельный предыдущий диалог, в котором ИИ «уже начал» объяснять что-то вредоносное. Модель воспринимает эту вымышленную историю как реальный контекст и продолжает генерировать текст с того места, на котором «остановилась».
Это работает потому, что модели доверяют собственной истории диалогов. При развертывании систем с открытым исходным кодом, где состояние диалога управляется на стороне клиента (LLaMA, Phi, Qwen), злоумышленник может напрямую редактировать массив сообщений. Такие системы как ChatGPT и Copilot, сложнее взломать, поскольку история диалогов хранится на сервере, а развертывание API с управлением состоянием чата на стороне клиента является полностью уязвимой.
· Многоэтапная эскалация (Crescendo) начинается с безобидных вопросов, связанных с целевой темой, и постепенно переходит к более провокационным. Каждый отдельный этап выглядит приемлемым, но вредоносный результат появляется только после того, как модель проходит через ряд небольших шагов.
Например, последовательность может быть такой: история химического оружия; конкретные отравляющие вещества, использовавшиеся в прошлом; механизмы действия; современные аналоги. Каждый шаг по отдельности можно обосновать. Но не в совокупности.
Многоходовые обходные махинации проще, чем предполагалось ранее, и вероятность успеха при использовании моделей, оптимизированных только для защиты от одноходовых атак, превышает 70%.
· Атака типа «отмычка» (Skeleton Key), в отличие от постепенной эскалации Crescendo, – это многоэтапная последовательность инструкций, которая переопределяет правила безопасности модели в контексте. Хакер сообщает модели, что к ответам следует добавлять предупреждения о безопасности, а не блокировать их. Как только модель принимает эту формулировку, она выполняет все последующие запросы – вредоносные результаты «подтверждаются» с оговоркой, а не отклоняются.
Это работает следующим образом, модель интерпретирует новую формулировку как обновление инструкции на системном уровне, подобно тому, как она обрабатывает легитимные системные запросы от инженеров-программистов. Граница между протоколами, поступающими от разработчиков и вредоносными инструкциями, определяется в процессе обучения, а не задается жестко, и этот процесс не идеален.
· Взлом с многократным повторением (multi-shot jailbreak) – это метод, эффективность которого напрямую зависит от размера контекстного окна. Атакующий предоставляет сотни сфабрикованных пар «вопрос-ответ», в которых ИИ-ассистент последовательно выполняет вредоносные запросы. Эти диалоги многократно повторяются в рамках одного промпта, создавая «образец» поведения модели. В конце серии добавляется целевой запрос, на который атакующий хочет получить ответ.
Атака становится более эффективной по мере увеличения контекстных окон. Стремление индустрии к окнам в 128 тыс., 200 тыс. и более одного млн токенов пропорционально увеличивает поверхность атаки. Для смягчения последствий требуется обучение на примерах с большим контекстом, что до сих пор является активной областью исследований, в которой пока нет окончательного решения.
· Манипуляции с токенами и атаки с использованием кодировки. Защитные фильтры работают с шаблонами на уровне токенов. Злоумышленники обходят защиту, кодируя запросы в форматах, которые проходят через фильтры, но остаются понятными для модели: подстановка leetspeak, кодировка Base64, омоглифы (графически одинаковые или похожие друг на друга знаки, имеющие разное значение) и вариативные селекторы в Unicode (блоки символов, которые содержат 16 непечатаемых комбинирующих символов), переключение на языки с низким уровнем ресурсов, для которых недостаточно обучающих данных.
Проблема многоязычности хорошо изучена. Для языков с ограниченными ресурсами частота отказов в обеспечении безопасности значительно снижается: модели отклоняют запросы на английском, но выполняют идентичные запросы на других языках.
Новый подход – обфускация (запутывание) подсказок на основе гомотопии (математическая концепция, которая описывает деформацию одного объекта в другой), систематически искажает подсказки с помощью лингвистических преобразований.
· Атаки с использованием малозатратной тонкой настройки (fine-tuning) – это методы воздействия на системы, которые требуют минимальных ресурсов для реализации и направлены на достижение определённых целей, например, нарушение работы инфраструктуры, обход защитных механизмов или манипуляцию поведением моделей. При тонкой настройке на «безопасных» данных всего со 100 примерами качество обучения снижается. Безопасность модели не является отдельной функцией, а представляет собой процесс, распределенный по всем весовым коэффициентам модели, который перезаписывается с минимальными вычислительными затратами.
Каждый этап fine-tuning – это потенциальное снижение безопасности. Проверка на ухудшение согласованности после тонкой настройки представляет собой единственный способ узнать, не убраны ли случайно те защитные механизмы, на которые рассчитывали разработчики.
· «Самовзлом» (Self-Jailbreaking)
Наиболее тревожной тенденцией является появление техник само-взлома – это феномен, при котором большие языковые модели используют свои собственные генеративные и рассуждающие способности для обхода встроенных механизмов безопасности. Это позволяет моделям «рассуждать» о способах снятия ограничений и затем применять их к себе, игнорировать установленные запреты и генерировать потенциально вредоносный или нежелательный контент.
Некоторые механизмы «самовзлома»:
- Рефлексивное побуждение (reflective prompting). Модель использует саморазъяснение для итеративного уточнения запросов и обхода отказов, часто в полностью «чёрном ящике» API без внешнего доступа к градиентам или логит-функциям. Например, метод повторяющегося уточнения, вызванного самовзломом LLM (Iterative Refinement Induced Self-Jailbreak, IRIS) предполагает, что GPT-4 «выявляет, анализирует и исправляет» собственные отказы до тех пор, пока не будет получен вредоносный результат, достигая почти идеального успеха менее чем за 7 запросов на производственных моделях.
- Самоинтроспективный или основанный на логите взлом системы (self-introspective or logit-based jailbreaking). С помощью подключаемых модулей, которые манипулируют распределением предсказанных токенов, например, BiasNet в JULI, можно влиять на выборку и заставлять модели генерировать выходные данные, которые в противном случае были бы отклонены.
Справочно:
Токен в искусственном интеллекте – это минимальная единица данных, которую обрабатывает модель ИИ. Это может быть слово, часть слова, символ, знак препинания, фрагмент изображения или другой элемент в зависимости от типа данных и задачи. Токены служат строительными блоками для анализа, генерации контента, прогнозирования и других задач ИИ.
BiasNet – это небольшой подключаемый блок, который используется в методе JULI (Jailbreaking Large Language Models by Self-Introspection) для манипуляции логарифмическими вероятностями токенов языковой модели с целью генерации более вредоносного контента.
Основная идея заключается в том, что выравнивание (alignment) модели не удаляет вредоносное знание полностью, а лишь снижает ранг вероятности определённых токенов. BiasNet служит селектором, который идентифицирует критические токены в выводе целевой LLM и извлекает нужное знание для повышения вероятности генерации вредоносного контента.
- Утечка системных промптов (system-prompt leakage). В мультимодальных LLM, например, GPT-4V, злоумышленники могут извлекать внутренний системный промпт через самозапрос, а затем использовать эту или другую модель LLM в качестве «предсказателя» для создания атак с учётом похищенного промпта.
Справочно:
System prompt leakage – это уязвимость ИИ, при которой системные инструкции (промпты), определяющие поведение модели, непреднамеренно раскрываются пользователям или третьим лицам. Эти промпты содержат настройки, бизнес-логику, правила безопасности, конфигурационные данные или конфиденциальную информацию, которая не должна быть доступна посторонним лицам.
- Многоходовые цепочки промптов и изменение пользовательского контекста (user framing and multi-turn prompt chaining). Постепенное изменение контекста или многоходовые диалоги, например, переформулирование запроса о самоубийстве как тему для «академического спора», могут подрывать устойчивые состояния безопасности, заставляя модель предоставлять запрещённый контент.
- «Самовзлом», вызванный рассуждениям (reasoning-induced self-jailbreaking). После тонкой настройки логического мышления, например, на наборах данных STEM или кодовых CoT, модели могут спонтанно развивать способность «рационализировать» выполнение вредных запросов, учитывая при этом их потенциальную опасность.
Справочно:
Chain of Thought (CoT) – это метод взаимодействия с большими языковыми моделями, который позволяет ИИ генерировать промежуточные логические шаги перед выдачей окончательного ответа. Этот подход имитирует человеческий процесс поэтапного решения сложных задач.
STEM (science, technology, engineering and mathematics) – это аббревиатура, которая обозначает естественную науку, технологии, инженерию и математику. В контексте образования и технологий STEM может относиться к интеграции искусственного интеллекта в обучение, например, через использование ИИ для персонализации обучения, визуализации абстрактных концепций или поддержки проектных методов.
Проблема самовзлома остаётся актуальной, так как уязвимости в безопасности LLM продолжают эволюционировать, а разработчики ищут новые способы защиты.
· Многоязычные атаки
Интересным направлением стали многоязычные атаки. Исследователи ИИ обнаружили, что многошаговые разговоры на малоресурсных африканских языках, таких как африкаанс, суахили, коса и зулу, могут обходить защитные механизмы коммерческих LLM гораздо эффективнее. Этот феномен объясняется тем, что модели часто имеют меньше обучающих данных на этих языках, включая данные по безопасности и этике.
· Приёмы «лексических вставок»
Техника «лексической вставки» – еще один метод обхода защитных барьеров LLM. Она предполагает добавление определенных слов или символов в запрос, чтобы замаскировать вредоносный смысл и заставить модель игнорировать свои фильтры. Это очень эффективный подход, поскольку он не меняет основной смысл запроса, но сбивает с толку механизмы классификации контента.
· Метафорические атаки на мультимодальные ИИ
С развитием мультимодальных систем (обрабатывающих текст, изображения и звук) появились новые векторы атак. Метафорические джейлбрейк-атаки используют переносные смыслы для генерации запрещенного контента. Например, сокрытие вредоносных инструкций внутри изображений или аудиофайлов, использование ASCII-арта для визуальной инъекции промптов, а также шифрование или закодированные сообщения, которые модель должна расшифровать.
4. Примеры реальных джейлбрейк атак:
· Внедрение в правительственную образовательную систему.
Специалисты по информационной безопасности провели командный анализ системы государственного образования с искусственным интеллектом. Их целью было протестировать систему на соответствие OWASP Top 10 для LLM, в частности, нацеливаясь на Prompt Injection (LLM01), Insecure Output Handling (LLM02) и Jailbreaking.
Справочно:
OWASP Top 10 – это регулярно обновляемый список из 10 наиболее критичных рисков для безопасности веб-приложений, разработанный организацией Open Web Application Security Project (OWASP). Документ служит ориентиром для разработчиков, архитекторов и специалистов по информационной безопасности, помогая сосредоточиться на самых опасных угрозах.
· Уязвимость LLM-ранкеров.
В 2026 году было проведено исследование, посвящённое уязвимости LLM-ранкеров к атакам с внедрением промптов. Авторы изучали, как простые инъекции промптов, встроенные в кандидатский документ, могут значительно изменять решения LLM-ранкеров о ранжировании документов. Это может быть использовано для манипуляции поисковыми системами и рекомендательными сервисами.
Справочно:
LLM-ранкеры – это модели, основанные на LLM, которые используются для переранжирования документов, полученных на первом этапе с помощью других алгоритмов (например, BM25). Они помогают улучшить качество поиска информации, рекомендаций и других задач, связанных с обработкой текста.
Основные подходы к использованию LLM-ранкеров:
- Точечный (pointwise) подход. LLM получают запрос и документы, а затем выдают оценку релевантности для каждого документа. Например, можно попросить модель определить, релевантен ли документ запросу («yes/no»), или сгенерировать релевантный запрос для каждого документа, а затем ранжировать их по вероятности создания этого запроса.
- Списочный (listwise) подход. Документы сортируются в списке, при этом может использоваться алгоритм скользящего окна. Например, в реализации llm-rankers применяется алгоритм сортировки, аналогичный RankGPT.
- Парный (pairwise) подход. Сравниваются пары документов относительно запроса, например, определяется, какой из двух документов более релевантен. Для этого используется техника Pairwise Ranking Prompting (PRP), которая снижает нагрузку на модель.
- Сетчатый (setwise) подход. Оценивается вся коллекция документов сразу. В репозитории llm-rankers представлен расширенный сетчатый ранкер Rank-R1, который обладает способностью к структурированному рассуждению. Он использует специализированные шаблоны подсказок, которые побуждают модель предоставлять явные рассуждения в тегах <think> перед генерацией ответов в тегах <answer>. Для улучшения качества рассуждений применяется генеративное обучение с подкреплением и оптимизацией процесса (Group Relative Policy Optimization, GRPO).
· От исследовательских лабораторий до киберпреступности
Джейлбрейк-техники, разработанные в лабораторных условиях, быстро переходят в руки киберпреступников. Исследователи и злоумышленники обмениваются джейлбрейками на форумах и в теневых сообществах.
Например, вирус-шифровальщик PromptLock, который использовал генеративный ИИ для генерации вредоносного кода «на лету», отправляя промпты на его создание через API к LLM GPT-OSS-20b. Этот случай стал первым в своем роде, показав, что джейлбрейк может быть полностью автоматизирован и использован в реальных кибератаках.
5. Механизмы безопасности ИИ-моделей и их несовершенство
Современные LLM проходят несколько этапов обучения безопасности: контролируемую тонкую настройку (Supervised Fine-Tuning) и обучение с подкреплением на основе обратной связи с человеком (Reinforcement Learning from Human Feedback, RLHF).
При этом даже самые современные модели уязвимы к атакам, несмотря на эти меры. Механистический анализ динамики обучения безопасности выявил, что градиентная концентрация в процессе авторегрессивного обучения создает затухание сигнала по позициям токенов, что приводит к неполному усвоению правил безопасности. Иначе говоря, чем длиннее контекст, тем выше вероятность, что модель «забудет» о безопасности.
Справочно:
Механистический анализ динамики обучения безопасности в ИИ связан с направлением механистической интерпретируемости – развивающимся направлением исследований в области безопасности искусственного интеллекта. Его цель — понять нейросети на уровне их внутренних механизмов, анализируя отдельные компоненты (нейроны, головы внимания, цепи) и то, как они выполняют конкретные вычисления.
Барьерные модели (Guardrail Models)
Guardrail Models – это механизмы контроля и защиты в ИИ-системах, которые ограничивают поведение моделей, предотвращая вредоносное, некорректное или непреднамеренное поведение.
Разработчики внедряют дополнительные барьерные модели для фильтрации вредоносных промптов и ответов. Однако исследование 15 современных барьерных моделей показало, что большинство из них можно обмануть с помощью простых мутаций ввода, и они оказываются уязвимы к состязательным атакам. Например, один состязательный токен в среднем может обмануть их в 44,5% случаев.
Уязвимости Guardrail Models:
· Уязвимость к обратным инженерным атакам. Наблюдаемое поведение Guardrail Models может раскрывать их логику, что позволяет злоумышленникам проводить обратное проектирование защитных механизмов. Например, существует метод Guardrail Reverse-engineering Attack (GRA), который использует генетические алгоритмы для приближения политики принятия решений защитных механизмов.
· Уязвимости, связанные с обработкой длинных запросов. Из-за ограничений контекста Guardrail Models могут обрабатывать запросы с избыточной длиной через усечение или сегментацию. Это создаёт «слепые зоны», когда вредоносные инструкции фрагментируются и перемежаются с безобидным контентом, что позволяет им обходить защитные механизмы.
· Уязвимости к атакам с обходом защиты (evasion attacks). Злоумышленники могут использовать различные методы, например:
- инъекция символов (character injection) – добавление специальных символов для обхода фильтров;
- алгоритмические методы с использованием adversarial machine learning (AML), которые тонко изменяют интерпретацию контекста запроса моделью.
· Проблемы с конфигурацией и доступом. Ошибки в настройке Guardrail Models, избыточные привилегии идентификаторов, пробелы между логикой приложения и облачной инфраструктурой могут привести к уязвимостям.
· Ограниченная обобщаемость. Многие модели зависят от поверхностных признаков и не способны обобщать на имплицитные или новые формы предубеждений, а также понимать намерения за запросами.
· Демографические и контекстно-зависимые смещения. В развёрнутых Guardrail Models наблюдались непропорционально высокие показатели отказов для определённых демографических групп или контекстов.
· Ложные срабатывания. Слишком жёсткие ограничения могут сделать систему бесполезной, например, когда модель отказывается отвечать на безобидные вопросы.
· Ограниченная защита в многоходовых сценариях и при использовании инструментов. Guardrails часто фокусируются на входных и выходных данных, но не всегда контролируют действия модели при взаимодействии с внешними инструментами, API или рабочими процессами.
Архитектура уязвимостей LLM к джейлбрейку
Одной из главных причин, по которой LLM уязвимы к джейлбрейку, является фундаментальный компромисс между полезностью и безопасностью. Модели обучаются быть максимально полезными и следовать инструкциям, что напрямую конфликтует с необходимостью отвергать определенные запросы. Этот компромисс известен как «граница Парето» между полезностью и безвредностью.
Справочно:
«Граница Парето» между полезностью и безвредностью – это концепция, связанная с понятием эффективности по Вильфредо Парето (итальянский экономист), которое описывает ситуацию, когда невозможно улучшить благосостояние одного человека без ухудшения положения другого.
Одних только защитных механизмов недостаточно. Стандартный корпоративный подход к предотвращению джейлбрейка: внедрение защитного механизма. Входной/выходной классификатор выявляет нарушения политик. Например, тестирование системы Meta's Prompt Guard (компания Meta признана экстремистской организацией, ее деятельность запрещена в РФ) показало, что система стабильно пропускает варианты подсказок, которые человек-оценщик сразу бы пометил как подозрительные. Защитный механизм был обучен на основе распределения известных атак. Новые варианты, выходящие за рамки этого распределения, проходили проверку без проблем, не вызывая подозрения у системы защиты. Это связано с тем, что у статических защитных механизмов есть структурные «слепые зоны», через которые возможно осуществлять:
· Многоходовые атаки, при которых ни один из ходов не приводит к срабатыванию классификатора.
· Многократные атаки, встроенные в длинные контексты, которые выходят за пределы окна внимания системы защиты.
· Атаки и манипуляции с использованием так называемого метода «выстрел в голову», при которых история разговора или информация манипулируется до того, как её зафиксирует система защиты. Это может включать предварительное искажение данных, манипуляцию восприятием или создание ложных следов для последующего манипулирования восприятием событий.
Справочно:
Метод «выстрел в голову» относится к генераторам снимков головы (хедшотов) – инструментам, которые используют ИИ для создания профессиональных портретов или фотографий профиля. Такие генераторы анализируют загруженные пользователем изображения (например, селфи) и формируют новые варианты снимков с учётом выбранного стиля, фона, настроек и других параметров.
· Атаки с кодированием, при которых модель получает зашифрованную информацию, которую фильтр ранее никогда не оценивал.
· Подсказки с использованием авторитетных источников, при которых словарный запас совершенно безобиден, а опасность кроется в его подаче.
· Защитные механизмы – это первый фильтр, а не граница безопасности. Они повышают стоимость неопасных атак. Но против мотивированного злоумышленника они не сработают.
6. Методы защиты
В ответ на растущую угрозу разработчики создают все более сложные механизмы защиты. Традиционные методы, такие как фильтрация, по ключевым словам, показали свою неэффективность против изощренных атак.
Адаптивные системы безопасности. SecureCAI – это фреймворк, расширяющий принципы «конституционного ИИ» (Constitutional AI) с учетом контекста кибербезопасности. Он включает механизмы для «разучивания» небезопасных паттернов ответов с помощью прямого предпочтительного обучения (Direct Preference Optimization). Этот подход позволяет системе не просто блокировать известные атаки, но и адаптироваться к новым.
«Как игра». Перспективным направлением стало моделирование системы безопасности «как игры» между злоумышленником и защитником. Рамки безопасности как некооперативной игры позволяют обучать две модели одновременно: одна пытается обойти защиту (атакующий), другая – ее усилить (защитник), через онлайн-обучение с подкреплением. Этот состязательный процесс ведет к итеративному улучшению с обеих сторон.
Гамма-Щит, эффективность с минимальными ресурсами
Одной из самых интересных разработок является Gamma-Guard – защитный механизм, который добавляет легковесные остаточные адаптеры к существующим LLM, используя менее 0,1% дополнительных параметров и увеличивая задержку всего на 2%. При этом он повышает устойчивость к состязательным атакам с 5% до 95%, что является улучшением на 90 процентных пунктов. Посредством Gamma-Guard можно значительно повысить безопасность модели без существенного увеличения вычислительных затрат.
Техника PurpCode
Это метод пост-обучения ИИ-ассистентов для написания кода, который включает рассуждения о безопасности при генерации кода. Используя обучение с подкреплением, модель учится распознавать попытки заставить ее сгенерировать вредоносный код. Такой подход повышает кибербезопасность примерно в 1,5 раза при минимальной деградации полезности модели.
7. Русскоязычный контекст
Проблема джейлбрейка не обошла стороной и русскоязычное ИИ-сообщество. Пользователи активно делятся опытом и шаблонами промптов для обхода ограничений популярных моделей, включая русскоязычные версии ChatGPT.
В России ИБ-специалисты также изучают проблему промпт-инъекций как класса уязвимостей, при котором злоумышленник создает вредоносные входные данные для манипулирования поведением LLM, заставляя его выполнять непреднамеренные действия. Киберпреступники активно экспериментируют с промпт-инжинирингом, создавая вредоносные программы (promptware) – аналог malware, но на основе специальных подсказок для LLM. Эти программы эксплуатируют классические уязвимости веб-безопасности межсайтовый скриптинг (Cross-Site Scripting, XSS) и подделка межсайтовых запросов (Cross-Site Request Forgery, CSRF) для внедрения вредоносных промптов.
Прогнозы на 2026 год
Ожидается, что в 2026 году полная защита ИИ от джейлбрейк-атак будет невозможна. Это обстоятельство имеет глубокие последствия для безопасности ИИ.
В ближайшей перспективе прогнозируется значительный рост многоступенчатых атак, распределяющих вредоносную цель на серию взаимодействий, что делает их сложными для обнаружения.
Мультимодальные угрозы. По мере того, как LLM становятся все более универсальными, киберпреступники будут активнее использовать изображения, аудио и видео для сокрытия вредоносных инструкций. Уязвимость мультимодальных моделей к различным типам мультимедийных джейлбрейков становится очевидной.
Кроме того, следует ожидать появления сервисов, предоставляющих автоматизированный джейлбрейк как услугу (Jailbreak as a Service).
Появляются также новые методы атак, такие как «цепочка приманок» (Chain-of-Lure), использующих неограниченные синтетические нарративы (сюжеты) для обхода защиты, и CodeJailbreaker, нацеленные на системы генерации кода.
Таким образом, джейлбрейк LLM – это не просто технический курьез, а фундаментальный вызов для безопасного и надежного внедрения ИИ. От DAN, который можно было реализовать одной фразой, до Self-Jailbreaking, когда модель взламывает сама себя, методы атак быстро эволюционируют.
Решение лежит не в создании непроницаемой защиты, а в построении гибких, адаптивных систем безопасности, которые могут эволюционировать вместе с угрозами. Будущее за гибридными подходами, сочетающими несколько линий защиты, и за культурой безопасности, которая признает неизбежность атак и готовится к ним соответствующим образом.
