ИИ-водяные знаки и уязвимости безопасности: когда SynthID-Text подрывает защитные барьеры


Когда прозрачность становится уязвимостью: парадокс водяных знаков ИИ
Европейский союз своим регулированием искусственного интеллекта открыл новую эру прослеживаемости. Контент, созданный ИИ, должен поддаваться маркировке — и крупные платформы реагируют незамедлительно. Anthropic объявила о том, что будущие модели Claude будут оснащены SynthID-Text — технологией водяных знаков, изначально разработанной Google и опубликованной как решение с открытым исходным кодом. То, что звучит многообещающе — больше прозрачности, больше прослеживаемости — имеет, однако, взрывоопасную обратную сторону, о которой компаниям необходимо знать.
Новые исследования в области безопасности от Lasso Security показывают: SynthID-Text влияет не только на выбор слов языковыми моделями, но и при определённых условиях изменяет их поведение с точки зрения безопасности. Модели, которые в обычных условиях отклоняли бы вредоносные запросы, в ряде случаев могут выполнять их при активированном водяном знаке. Для компаний, продуктивно использующих ИИ-агентов, это критически важная информация.
Как технически работает SynthID-Text
Чтобы понять масштаб проблемы, стоит разобраться в механике. Языковые модели генерируют текст, последовательно выбирая наиболее вероятный следующий токен (упрощённо: следующее слово или фрагмент слова) из множества кандидатов. SynthID вмешивается в этот процесс, не искажая его явным образом — отсюда и обозначение «non-distortionary».
Ядром SynthID является так называемый Tournament Sampling: подобно спортивному турниру, многочисленные токены-кандидаты соревнуются друг с другом. Секретный ключ присваивает каждому кандидату скрытое значение вероятности. Пары соревнуются между собой, кандидат с более высокой оценкой побеждает и переходит в следующий раунд — до тех пор, пока не определяется финальный токен. Результат: выбор слов выглядит случайным, однако секретный ключ влияет на него таким образом, что посвящённые могут впоследствии установить, был ли текст сгенерирован с использованием этого ключа.
«Водяные знаки разработаны так, чтобы быть незаметными для читателя. Но мы знаем: если мы что-то меняем в том, что генерирует модель, возникают компромиссы — и они проявляются где-то в другом месте.» — Андреа Сипошова, исследователь безопасности ИИ в Lasso Security
Именно это «где-то в другом месте» и является проблемой. Исследователь протестировала SynthID-Text на шести моделях с открытыми весами и сравнила их поведение с активированным и без активированного водяного знака — в особенности при обработке вредоносных запросов и с применением техник Prompt-Injection.
Sampling Drift: реальная проблема безопасности
Исследование вводит новую концепцию, которая в будущем займёт умы отрасли: Sampling Drift. Под этим понимается смещение в поведении модели, возникающее вследствие изменённого процесса сэмплинга. Это смещение не тривиально: оно затрагивает не только формулировки ответов, но и то, отклонит ли модель вредоносный запрос или нет — а в контексте ИИ-агентов даже то, какие инструменты вызываются и какие аргументы при этом передаются.
- Изменённое поведение при отказах: Модели с активированным водяным знаком SynthID в ходе тестов реже отклоняли вредоносные запросы по сравнению с моделями без водяного знака.
- Усиленный эффект при Prompt Injection: Когда вредоносные запросы сочетались с техниками Prompt Injection, разница в уровне безопасности проявлялась особенно выраженно.
- Вариация в зависимости от ключа: Степень изменения поведения варьировалась в зависимости от используемого секретного ключа — одни ключи заметно увеличивали исполнение вредоносных запросов, другие — снижали.
- Ошибки при Tool Calls: В агентном контексте водяной знак влиял на то, какие инструменты вызывались корректно, — с порой значительными отклонениями от базовой точности без водяного знака.
Что делает эти выводы особенно значимыми: KI-агенты действуют не пассивно. Они вызывают API, выполняют код, отправляют электронные письма, обращаются к базам данных. Ослабленный барьер безопасности на уровне модели в агентном контексте немедленно переходит на уровень действий — с реальными последствиями.
Оценка для применения в компаниях
Dr. Maik Bunzel, основатель и генеральный директор mabucon.eu, глубоко занимающийся продуктивным применением KI-агентов в бизнес-процессах, подчёркивает в этом контексте одну фундаментальную проблему: «Большинство компаний тестируют свои KI-системы в идеальных условиях. При этом свойства безопасности, такие как поведение при отказах, нередко воспринимаются как стабильные и неизменные — это опасное заблуждение, когда производственная среда отличается от тестовой.»
Именно такова ситуация здесь. Слой водяного знака, требуемый регуляторами, — это не нейтральное дополнение: он представляет собой вмешательство в процесс инференса модели. Это вмешательство способно изменить свойства безопасности, ранее сформированные в ходе масштабного RLHF (Reinforcement Learning from Human Feedback) и Safety Fine-Tuning.
Для компаний, выстраивающих агентные рабочие процессы на основе таких моделей, как Claude или других регулируемых LLM, из этого вытекает очевидная необходимость действий:
- Red-Teaming в реальных условиях: Тесты безопасности должны проводиться явно с активированным водяным знаком — а не только в базовой конфигурации модели.
- Систематизация Prompt-Injection-тестов: Поскольку эффект особенно силён при комбинированных атаках, сценарии Prompt Injection должны быть обязательным элементом каждого аудита безопасности LLM.
- Отдельная проверка агентного уровня: Изменённое поведение при Tool-Calling невозможно выявить исключительно тестами на уровне ответов модели — агентные пайплайны требуют самостоятельных тестов безопасности.
- Управление ключами как параметр безопасности: Поскольку разные ключи формируют различные свойства безопасности, выбор и управление ключом водяного знака является не только техническим, но и политическим решением в области безопасности.
Ограничения исследования — и что остаётся в силе
Было бы несерьёзно обходить стороной ограничения исследования. В нём тестировались шесть моделей с открытыми весами — но не сама модель Claude, которую Anthropic в будущем оснастит SynthID. Кроме того, использовалась реализация SynthID-Text от Hugging Face, а не та конкретная реализация, которую будет применять Anthropic. Точная конфигурация, допустимый уровень ошибок и внутренние уровни защиты производственных систем могут существенно отличаться.
Тем не менее основной принцип остаётся в силе: если Tournament Sampling изменяет поведение при выборе токенов, побочные эффекты на общее поведение модели систематически возможны — вне зависимости от конкретной реализации. Исследование не доказывает наличие специфической уязвимости в Claude, однако убедительно указывает на класс рисков, присущих данному подходу.
Регуляторные требования встречают техническую реальность
Главный посыл одинаково важен как для компаний, так и для разработчиков ИИ: требования по соответствию нормативам и архитектура безопасности — это не два разных мира. Когда регуляторные предписания — в данном случае требование ЕС по маркировке контента, созданного ИИ, — делают необходимым техническое вмешательство в системы инференса, такое вмешательство должно быть полностью проверено на предмет последствий для безопасности.
Dr. Maik Bunzel из mabucon.eu формулирует вывод для своих клиентов следующим образом: «Тот, кто использует ИИ-агентов в критически важных бизнес-процессах, не может рассчитывать на то, что поведение модели с точки зрения безопасности останется неизменным после обновления или изменения конфигурации. Непрерывное тестирование безопасности становится обязательным требованием, а не дополнительной опцией.»
Для отрасли из этого следует важный вывод: эпоха простых и статичных допущений безопасности для LLM осталась в прошлом. Водяные знаки, Fine-Tuning, квантизация, Prompt-Engineering — каждый слой, добавляемый поверх базовой модели, способен порождать непредвиденные взаимодействия с её свойствами безопасности. Ответом на это является не сокращение использования ИИ, а более структурированное, систематическое и реалистичное тестирование — в тех условиях, в которых система действительно эксплуатируется.
Перспективы: что компаниям следует делать уже сейчас
Исследование SynthID — это сигнал раннего предупреждения, а не сценарий катастрофы. Те, кто сделает правильные выводы сегодня, окажутся в более выгодном положении завтра. Конкретно это означает следующее: специалисты по безопасности в компаниях, эксплуатирующих системы на базе LLM, должны активно запрашивать у своих поставщиков моделей информацию о том, какие конфигурации водяных знаков применяются и были ли конкретные свойства безопасности модели протестированы в рамках данной конфигурации. Безопасность ИИ — это не разовый проект: это непрерывный процесс, который усложняется с каждым новым техническим слоем, добавляемым к языковой модели.