Znaki wodne AI i luki bezpieczeństwa: Gdy SynthID-Text podważa bariery ochronne


Kiedy transparentność staje się słabością: paradoks znaków wodnych w AI
Unia Europejska swoją regulacją dotyczącą AI zapoczątkowała nową erę rozliczalności. Treści generowane przez AI mają być oznaczalne – a duże platformy reagują natychmiast. Anthropic ogłosił, że przyszłe modele Claude zostaną wyposażone w SynthID-Text – technologię znaków wodnych opracowaną pierwotnie przez Google i opublikowaną jako rozwiązanie open source. Brzmi dobrze – więcej transparentności, więcej identyfikowalności – ma jednak poważną drugą stronę, którą firmy powinny pilnie poznać.
Nowe badania bezpieczeństwa przeprowadzone przez Lasso Security pokazują: SynthID-Text wpływa nie tylko na dobór słów przez modele językowe, lecz w określonych warunkach zmienia również ich zachowanie w zakresie bezpieczeństwa. Modele, które normalnie odrzucałyby szkodliwe zapytania, mogą je w niektórych przypadkach wykonać przy aktywnym znaku wodnym. Dla firm korzystających produkcyjnie z agentów AI to informacja o kluczowym znaczeniu.
Jak SynthID-Text działa technicznie
Aby zrozumieć skalę problemu, warto przyjrzeć się mechanice. Modele językowe generują tekst, sekwencyjnie wybierając najbardziej prawdopodobny kolejny token (w uproszczeniu: następne słowo lub fragment słowa) spośród zbioru kandydatów. SynthID ingeruje w ten proces, nie zniekształcając go w sposób oczywisty – stąd też określenie „non-distortionary".
Sercem SynthID jest tzw. Tournament Sampling: podobnie jak w turnieju sportowym, liczni kandydaci na tokeny rywalizują ze sobą. Tajny klucz przypisuje każdemu kandydatowi ukrytą wartość prawdopodobieństwa. Pary rywalizują ze sobą, kandydat z wyższą oceną wygrywa i przechodzi do następnej rundy – aż do wyłonienia finalnego tokenu. Efekt: dobór słów sprawia wrażenie losowego, lecz dzięki tajnemu kluczowi jest tak ukierunkowany, że wtajemniczeni mogą po fakcie stwierdzić, czy dany tekst został wygenerowany przy użyciu tego klucza.
„Znaki wodne są zaprojektowane tak, by były niewidoczne dla czytelnika. Wiemy jednak: gdy cokolwiek zmieniamy w tym, co generuje model, pojawiają się kompromisy – i gdzieś dają o sobie znać." – Andrea Siposova, badaczka bezpieczeństwa AI w Lasso Security
Właśnie to „gdzieś" stanowi problem. Badaczka przetestowała SynthID-Text na sześciu modelach open-weight i porównała ich zachowanie z aktywnym i nieaktywnym znakiem wodnym – w szczególności w odniesieniu do obsługi szkodliwych zapytań oraz przy zastosowaniu technik Prompt Injection.
Sampling Drift: rzeczywisty problem bezpieczeństwa
Badanie wprowadza nową koncepcję, która w przyszłości będzie zaprzątać uwagę branży: Sampling Drift. Chodzi o przesunięcie w zachowaniu modelu wynikające ze zmienionego procesu próbkowania. Ten dryf nie jest błahy: dotyczy nie tylko formułowania odpowiedzi, lecz także tego, czy model odrzuca szkodliwe zapytanie – a w kontekście agentów AI nawet tego, które narzędzia są wywoływane i jakie argumenty są przekazywane.
- Zmienione zachowanie odrzucania: Modele z aktywnym znakiem wodnym SynthID rzadziej odrzucały szkodliwe zapytania w testach niż modele bez znaku wodnego.
- Wzmocniony efekt przy Prompt Injection: Gdy szkodliwe zapytania były łączone z technikami Prompt Injection, różnica w poziomie bezpieczeństwa była szczególnie wyraźna.
- Zmienność zależna od klucza: Skala zmiany zachowania różniła się w zależności od użytego tajnego klucza – niektóre klucze znacząco zwiększały zgodność ze szkodliwymi zapytaniami, inne ją redukowały.
- Błędy przy Tool Calls: W kontekście agentowym znak wodny zmieniał, które narzędzia były poprawnie wywoływane – z niekiedy znacznymi odchyleniami od podstawowej dokładności bez znaku wodnego.
To, co sprawia, że te odkrycia są szczególnie istotne: agenci AI nie działają pasywnie. Wywołują API, wykonują kod, wysyłają e-maile, uzyskują dostęp do baz danych. Osłabiona bariera bezpieczeństwa na poziomie modelu staje się w kontekście agentowym natychmiast poziomem działania – z realnymi konsekwencjami.
Ocena dla zastosowań korporacyjnych
Dr. Maik Bunzel, założyciel i dyrektor zarządzający mabucon.eu, który intensywnie zajmuje się produktywnym wdrażaniem agentów AI w procesach biznesowych, podkreśla w tym kontekście fundamentalne wyzwanie: „Większość firm testuje swoje systemy AI w warunkach idealnych. Właściwości bezpieczeństwa, takie jak zachowanie odrzucania, są często traktowane jako stabilne i niezmienne – to niebezpieczny błąd, gdy środowisko produkcyjne odbiega od środowiska testowego."
Dokładnie taki przypadek mamy tutaj. Warstwa znaku wodnego, wymagana przez regulacje, nie jest neutralnym uzupełnieniem – jest ingerencją w proces inferencji modelu. Ta ingerencja może zmieniać właściwości bezpieczeństwa, które wcześniej zostały ustanowione dzięki rozbudowanemu RLHF (Reinforcement Learning from Human Feedback) i Safety Fine-Tuning.
Dla firm budujących workflow agentowe na bazie modeli takich jak Claude lub innych regulowanych LLM, wynika z tego wyraźna konieczność działania:
- Red-Teaming w realnych warunkach: Testy bezpieczeństwa muszą być przeprowadzane z aktywnym znakiem wodnym – nie tylko w podstawowej konfiguracji modelu.
- Systematyzacja testów Prompt Injection: Ponieważ efekt jest szczególnie silny przy atakach kombinowanych, scenariusze Prompt Injection powinny być obowiązkowym elementem każdego audytu bezpieczeństwa LLM.
- Osobna weryfikacja poziomu agentowego: Zmienione zachowanie Tool-Calling nie może być wykryte wyłącznie za pomocą testów na poziomie odpowiedzi modelu – pipeline'y agentowe wymagają niezależnych testów bezpieczeństwa.
- Zarządzanie kluczami jako parametr bezpieczeństwa: Ponieważ różne klucze generują różne właściwości bezpieczeństwa, wybór i zarządzanie kluczem znaku wodnego to nie tylko decyzja techniczna, ale również decyzja z zakresu polityki bezpieczeństwa.
Ograniczenia badań – i co mimo to pozostaje aktualne
Nieuczciwe byłoby pominięcie ograniczeń badania. Analiza testowała sześć modeli open-weight – nie sam model Claude, który Anthropic wyposaży w przyszłości w SynthID. Wykorzystano również implementację SynthID-Text z Hugging Face, a nie konkretną implementację, którą zastosuje Anthropic. Dokładna konfiguracja, tolerancja błędów oraz wewnętrzne warstwy zabezpieczeń systemów produkcyjnych mogą się znacznie różnić.
Niemniej jednak podstawowa zasada pozostaje aktualna: jeśli Tournament Sampling zmienia zachowanie podczas wyboru tokenów, efekty uboczne wpływające na ogólne zachowanie modelu są systematycznie możliwe – niezależnie od konkretnej implementacji. Badanie nie dostarcza dowodu na istnienie określonej luki w Claude, ale stanowi silną przesłankę wskazującą na klasę ryzyk związanych z tym podejściem.
Wymogi regulacyjne zderzają się z techniczną rzeczywistością
Nadrzędny przekaz jest taki, który dotyczy w równym stopniu przedsiębiorstw i twórców AI: wymogi compliance oraz architektura bezpieczeństwa to nie oddzielne światy. Gdy przepisy regulacyjne – w tym przypadku unijna dyrektywa dotycząca oznaczania treści AI – wymagają technicznych ingerencji w systemy wnioskowania, ingerencje te muszą zostać w pełni przetestowane pod kątem implikacji dla bezpieczeństwa.
Dr. Maik Bunzel z mabucon.eu podsumowuje konsekwencje dla swoich klientów następująco: „Kto wdraża agenty AI w krytycznych procesach biznesowych, nie może zakładać, że zachowanie modelu w zakresie bezpieczeństwa pozostanie identyczne po aktualizacji lub zmianie konfiguracji. Ciągłe testowanie bezpieczeństwa staje się obowiązkiem, a nie opcją."
Dla branży wynika z tego istotna konkluzja: era prostych, statycznych założeń dotyczących bezpieczeństwa LLM dobiegła końca. Znaki wodne, Fine-Tuning, kwantyzacja, Prompt-Engineering – każda warstwa nałożona na model bazowy może generować nieoczekiwane interakcje z jego właściwościami bezpieczeństwa. Odpowiedzią na to nie jest mniejsze wykorzystanie AI, lecz bardziej ustrukturyzowane, ciągłe i realistyczne testowanie – w warunkach, w których system rzeczywiście funkcjonuje.
Perspektywy: Co przedsiębiorstwa powinny zrobić teraz
Badania nad SynthID to sygnał wczesnego ostrzegania, a nie scenariusz katastroficzny. Kto już dziś wyciągnie właściwe wnioski, jutro będzie w lepszej pozycji. W praktyce oznacza to: osoby odpowiedzialne za bezpieczeństwo w przedsiębiorstwach korzystających z systemów opartych na LLM powinny aktywnie pytać swoich dostawców modeli, jakie konfiguracje znaków wodnych są stosowane oraz czy specyficzne właściwości bezpieczeństwa modelu zostały przetestowane w ramach tej konfiguracji. Bezpieczeństwo AI nie jest jednorazowym projektem – to ciągły proces, który rozrasta się wraz z każdą kolejną warstwą techniczną dodawaną do modelu językowego.