← Назад к обзору

LLMs структурно уязвимы: что результаты исследования ICML означают для бизнеса

Dr. Maik Bunzel
Dr. Maik Bunzel
02.08.2026 · 6 мин. чтения
LLMs структурно уязвимы: что результаты исследования ICML означают для бизнеса

Неудобная правда из мира исследований в области ИИ

На прошедшей International Conference on Machine Learning (ICML) — одной из наиболее авторитетных конференций в области искусственного интеллекта — широкое внимание привлекла научная работа: группа независимых исследователей утверждает, что крупные языковые модели — так называемые Large Language Models (LLMs) — структурно и, следовательно, принципиально не могут быть полностью защищены от атак. Причина кроется не в некачественной реализации или небрежном обучении, а глубоко в самой архитектуре этих моделей. Для компаний, которые уже используют или планируют внедрять процессы на основе ИИ, это новость, влекущая стратегические последствия.

Проблема ролей: когда контекст становится уязвимостью

Чтобы понять, почему LLMs столь уязвимы, необходимо взглянуть на то, как внутри обрабатываются текстовые входные данные. Современные чат-боты и ИИ-агенты структурируют информационные потоки, с которыми они работают, с помощью так называемых тегов ролей. Содержимое пользователя помечается как текст <user>, системные инструкции разработчиков — как <system>, внутренние рассуждения модели — как <think>, а внешние источники — например, как <tool>. Эта ролевая структура лежит в основе того, как модель решает, чьи инструкции выполнять, а чьи — нет.

Однако исследователи обнаружили, что LLMs определяют происхождение фрагмента текста не столько по тегам, сколько по стилю и языковым признакам самого текста. Иными словами: если злоумышленник формулирует текст, стилистически напоминающий внутренний «блокнот» (scratchpad) модели — то есть формат Chain-of-Thought, в котором модель фиксирует собственные рассуждения, — модель интерпретирует этот внешний текст как собственные мысли и действует соответствующим образом.

Chain-of-Thought-Forgery: наиболее изощрённая атака

Исследователи называют этот метод атаки Chain-of-Thought Forgery — целенаправленной подделкой внутренних рассуждений модели посредством стилистически точно подобранных входных данных. В ходе практических экспериментов команде удалось заставить несколько широко распространённых моделей генерировать контент, явно запрещённый их собственными политиками безопасности. Кроме того, данная техника атаки победила на Red-Teaming-хакатоне OpenAI в 2025 году.

Особо примечательно следующее: в параллельном процессе внутренняя система Red-Teaming компании OpenAI — GPT-Red — предположительно самостоятельно обнаружила структурно схожий метод атаки, что подчёркивает значимость и воспроизводимость полученных результатов.

«It's just one big sheet of tokens» — Jasmine Cui, соавтор статьи ICML, описывает этими словами ключевую проблему: для LLM весь входной текст изначально представляет собой недифференцированную последовательность токенов. Назначение ролей в конечном счёте является интерпретацией, а не технической гарантией.

Почему одного лишь Red-Teaming недостаточно

Обычный ответ индустрии ИИ на известные векторы атак — это Red-Teaming: специализированные команды — внутренние или внешние — систематически пытаются скомпрометировать модель до её выхода в продакшн. Обнаруженные атаки включаются в повторное обучение, благодаря чему модель становится более устойчивой к этим конкретным паттернам.

Фундаментальную проблему данной методологии авторы публикации ICML метко описывают с помощью притчи: это всё равно что заставить ребёнка сто раз написать, чего ему нельзя делать, — и полагать, что тем самым исключены все будущие проступки. Количество возможных вариантов атак де-факто не ограничено. Каждая вновь обученная защита — это всегда лишь ответ на уже известные атаки, но никак не структурное решение.

Dr. Maik Bunzel, основатель и генеральный директор mabucon.eu, глубоко занимается изучением последствий подобных результатов исследований для корпоративного применения ИИ-агентов. Его оценка совпадает с тем, что следует из исследования ICML: безопасность LLM-систем — это не разовый проект, а непрерывный процесс архитектурного проектирования, который начинается задолго до деплоя.

Prompt Injection и джейлбрейки: две стороны одной медали

Исследователи принципиально разграничивают два класса атак, оба из которых основаны на одном и том же структурном дефиците:

  • Джейлбрейки: пользователи вынуждают модель обходить её собственные правила, формулируя запросы таким образом, что модель интерпретирует их как внутреннюю системную инструкцию или собственное умозаключение.
  • Prompt Injections: злоумышленник через внешние источники данных — например, веб-страницы, документы или Tool-Outputs — внедряет скомпрометированные инструкции, которые модель воспринимает как легитимные команды пользователя или даже системные команды.

Последнее особенно актуально для сферы Agentic AI: когда ИИ-агент автономно просматривает веб, анализирует документы или вызывает API, внешние источники данных по определению являются частью входного потока. Каждый из этих источников — потенциальный вектор атаки типа Prompt Injection, а описанная путаница ролей делает защиту от таких атак структурно более сложной, чем предполагалось ранее.

Что это означает для ИИ-агентов в корпоративной среде

Последствия для компаний, делающих ставку на LLM-автоматизацию или ИИ-агентов, весьма значительны — однако они требуют не паники, а взвешенной переоценки профиля рисков. Из результатов исследования можно вывести ряд ключевых рекомендаций:

  • Принцип нулевого доверия для KI-агентов: Ни один вывод LLM-системы не должен считаться изначально достоверным — даже если он исходит из внутренней цепочки рассуждений модели. Внешние уровни валидации абсолютно необходимы.
  • Минимальные права и изоляция: KI-агенты должны иметь доступ только к тем системам и данным, которые строго необходимы для выполнения конкретной задачи. Скомпрометированный агент не должен иметь доступа к критически важным корпоративным данным.
  • Непрерывный мониторинг вместо однократной защиты: Поскольку никакое обучение не может охватить все будущие варианты атак, мониторинг поведения модели во время выполнения имеет решающее значение — особенно для агентов, которые автономно обрабатывают внешний контент.
  • Оценка рисков в зависимости от контекста применения: LLM-чатбот для внутренних FAQ-запросов имеет совершенно иной профиль риска, чем автономный агент, выполняющий бронирования, переводы или коммуникацию в режиме реального времени.

Флориан Трамер, специалист в области информатики из ETH Zürich, чьи исследования сосредоточены на безопасности LLM, положительно оценивает исследование и подтверждает: даже несмотря на то, что ведущие модели стали значительно более устойчивыми благодаря сочетанию различных защитных мер, для высокочувствительных сценариев применения по-прежнему остаётся открытым вопрос, достаточно ли этого.

Экономическое измерение: стимулы для злоумышленников растут

Один из аспектов, который исследователи особо подчёркивают, — это растущая экономическая мотивация, стоящая за джейлбрейками и атаками типа Prompt Injection. По мере расширения KI-систем в такие области, как электронная коммерция, финансовые услуги, здравоохранение или государственная инфраструктура, растёт и потенциальная выгода от успешных атак — будь то через эксфильтрацию данных, манипулирование бизнес-процессами или обход механизмов соответствия требованиям.

Эту оценку разделяет и Dr. Maik Bunzel из mabucon.eu: «Вопрос больше не в том, столкнётся ли компания с KI-атаками, а в том, когда и в каком контексте это произойдёт. Тот, кто сегодня интегрирует KI-агентов в критически важные рабочие процессы без определения явной модели безопасности, строит на структурно ненадёжном фундаменте».

Перспективы: безопасность как принцип проектирования, а не доработка

Исследование ICML — это не аргумент против использования LLM в компаниях. Это весомый аргумент в пользу того, чтобы рассматривать безопасность как архитектурный принцип проектирования, а не как запоздалую меру защиты. Модели совершенствуются, атаки — тоже. Это не временная проблема, которая решится с выходом следующей версии модели.

Для компаний, использующих KI-агентов и автоматизированные рабочие процессы, это означает конкретное следствие: выбор технологий и системная архитектура должны с самого начала определяться с учётом реалистичной модели угроз. Доверие к модели — это не концепция безопасности; изоляция, мониторинг и чёткие пути эскалации — вот что ею является. Dr. Maik Bunzel, основатель и генеральный директор mabucon.eu, кратко формулирует операционный вывод: тот, кто ответственно применяет KI-агентов, планирует не только для штатного режима работы, но и явно — для сценария атаки.

Хорошая новость: осознанный и структурированный подход к этим рискам вполне возможен. Плохая: он требует большего, чем просто доверие к заверениям поставщиков моделей в области безопасности.

Контакты

Какой из Ваших процессов должен первым стать умнее?

Коротко опишите, какой процесс Вы хотели бы поддержать или заменить с помощью ИИ. Мы свяжемся с Вами с первой конкретной оценкой — без обязательств и конфиденциально.

Лучше напрямую?

Напишите на info@mabucon.eu