← Zurück zur Übersicht

KI-Wasserzeichen und Sicherheitslücken: Wenn SynthID-Text Schutzbarrieren untergräbt

Dr. Maik Bunzel
Dr. Maik Bunzel
22.09.2026 · 6 Min. Lesezeit
KI-Wasserzeichen und Sicherheitslücken: Wenn SynthID-Text Schutzbarrieren untergräbt

Wenn Transparenz zur Schwachstelle wird: Das Paradox von KI-Wasserzeichen

Die Europäische Union hat mit ihrer KI-Regulierung eine neue Ära der Nachvollziehbarkeit eingeläutet. KI-generierte Inhalte sollen kennzeichenbar sein – und große Plattformen reagieren prompt. Anthropic hat angekündigt, zukünftige Claude-Modelle mit SynthID-Text auszustatten, einer Wasserzeichen-Technologie, die ursprünglich von Google entwickelt und als Open-Source-Lösung veröffentlicht wurde. Was gut klingt – mehr Transparenz, mehr Nachverfolgbarkeit – hat jedoch eine brisante Kehrseite, die Unternehmen dringend kennen sollten.

Neue Sicherheitsforschung von Lasso Security zeigt: SynthID-Text beeinflusst nicht nur die Wortwahl von Sprachmodellen, sondern verändert unter bestimmten Bedingungen auch deren Sicherheitsverhalten. Modelle, die schädliche Anfragen normalerweise ablehnen würden, können diese unter Aktivierung des Wasserzeichens in einigen Fällen ausführen. Für Unternehmen, die KI-Agenten produktiv einsetzen, ist das eine kritische Information.

Wie SynthID-Text technisch funktioniert

Um die Tragweite des Problems zu verstehen, lohnt ein Blick auf die Mechanik. Sprachmodelle generieren Text, indem sie sequenziell das wahrscheinlichste nächste Token (vereinfacht: das nächste Wort oder Wortfragment) aus einer Menge von Kandidaten auswählen. SynthID greift in diesen Prozess ein, ohne ihn offensichtlich zu verzerren – daher auch die Bezeichnung „non-distortionary".

Das Herzstück von SynthID ist das sogenannte Tournament Sampling: Ähnlich wie bei einem Sporturnier werden zahlreiche Token-Kandidaten gegeneinander angetreten. Ein geheimer Schlüssel weist jedem Kandidaten einen verborgenen Wahrscheinlichkeitswert zu. Paare treten gegeneinander an, der jeweils höher bewertete Kandidat gewinnt und zieht in die nächste Runde ein – bis ein finales Token ermittelt ist. Das Ergebnis: Die Wortauswahl wirkt zufällig, ist aber durch den geheimen Schlüssel so beeinflusst, dass Eingeweihte nachträglich feststellen können, ob ein Text mithilfe dieses Schlüssels generiert wurde.

„Wasserzeichen sind darauf ausgelegt, für den Leser nicht wahrnehmbar zu sein. Aber wir wissen: Wenn wir irgendetwas an dem verändern, was das Modell generiert, entstehen Kompromisse – und die tauchen irgendwo auf." – Andrea Siposova, KI-Sicherheitsforscherin bei Lasso Security

Genau dieses „irgendwo" ist das Problem. Die Forscherin testete SynthID-Text an sechs Open-Weight-Modellen und verglich deren Verhalten mit und ohne aktiviertem Wasserzeichen – insbesondere beim Umgang mit schädlichen Anfragen und unter dem Einsatz von Prompt-Injection-Techniken.

Sampling Drift: Das eigentliche Sicherheitsproblem

Die Forschung führt ein neues Konzept ein, das die Branche künftig beschäftigen wird: Sampling Drift. Gemeint ist die Verschiebung im Modellverhalten, die durch den veränderten Sampling-Prozess entsteht. Diese Drift ist nicht trivial: Sie betrifft nicht nur die Formulierung von Antworten, sondern auch, ob ein Modell eine schädliche Anfrage ablehnt oder nicht – und im Kontext von KI-Agenten sogar, welche Werkzeuge aufgerufen und welche Argumente übergeben werden.

  • Verändertes Ablehnungsverhalten: Modelle mit aktiviertem SynthID-Wasserzeichen lehnten in Tests schädliche Anfragen seltener ab als ohne Wasserzeichen.
  • Verstärkter Effekt bei Prompt Injection: Wenn schädliche Anfragen mit Prompt-Injection-Techniken kombiniert wurden, war der Sicherheitsunterschied besonders ausgeprägt.
  • Schlüsselabhängige Variation: Das Ausmaß der Verhaltensänderung variierte je nach verwendetem geheimen Schlüssel – manche Schlüssel erhöhten die Compliance mit schädlichen Anfragen deutlich, andere reduzierten sie.
  • Fehler bei Tool Calls: Im Agenten-Kontext veränderte das Wasserzeichen, welche Werkzeuge korrekt aufgerufen wurden – mit teils erheblichen Abweichungen von der Grundgenauigkeit ohne Wasserzeichen.

Was diese Erkenntnisse besonders relevant macht: KI-Agenten agieren nicht passiv. Sie rufen APIs auf, führen Code aus, versenden E-Mails, greifen auf Datenbanken zu. Eine geschwächte Sicherheitsbarriere auf der Modellebene wird im Agenten-Kontext unmittelbar zur Handlungsebene – mit realen Konsequenzen.

Einordnung für den Unternehmenseinsatz

Dr. Maik Bunzel, Gründer und Geschäftsführer von mabucon.eu, der sich intensiv mit dem produktiven Einsatz von KI-Agenten in Unternehmensprozessen beschäftigt, betont in diesem Kontext eine grundlegende Herausforderung: „Die meisten Unternehmen testen ihre KI-Systeme unter Idealbedingungen. Sicherheitseigenschaften wie Ablehnungsverhalten werden dabei oft als stabil und unveränderlich angenommen – das ist ein gefährlicher Irrtum, wenn Produktionsumgebungen von der Testumgebung abweichen."

Genau das ist hier der Fall. Die Wasserzeichen-Schicht, die regulatorisch gefordert wird, ist keine neutrale Ergänzung – sie ist ein Eingriff in den Inferenzprozess des Modells. Dieser Eingriff kann sicherheitsrelevante Eigenschaften verändern, die zuvor durch umfangreiches RLHF (Reinforcement Learning from Human Feedback) und Safety Fine-Tuning etabliert wurden.

Für Unternehmen, die auf Basis von Modellen wie Claude oder anderen regulierten LLMs Agenten-Workflows aufbauen, ergibt sich daraus eine klare Handlungsnotwendigkeit:

  • Red-Teaming unter realen Bedingungen: Sicherheitstests müssen explizit mit aktiviertem Wasserzeichen durchgeführt werden – nicht nur in der Basis-Konfiguration des Modells.
  • Prompt-Injection-Tests systematisieren: Da der Effekt bei kombinierten Angriffen besonders stark ist, sollten Prompt-Injection-Szenarien Pflichtbestandteil jedes LLM-Sicherheitsaudits sein.
  • Agenten-Ebene separat prüfen: Verändertes Tool-Calling-Verhalten kann nicht allein durch Tests auf Modellantwortebene erkannt werden – Agenten-Pipelines brauchen eigenständige Sicherheitstests.
  • Schlüsselverwaltung als Sicherheitsparameter verstehen: Da verschiedene Schlüssel unterschiedliche Sicherheitseigenschaften produzieren, ist die Auswahl und Verwaltung des Wasserzeichen-Schlüssels nicht nur eine technische, sondern auch eine sicherheitspolitische Entscheidung.

Grenzen der Forschung – und was trotzdem gilt

Es wäre unseriös, die Einschränkungen der Studie zu übergehen. Die Untersuchung testete sechs Open-Weight-Modelle – nicht das Claude-Modell selbst, das Anthropic zukünftig mit SynthID ausstatten wird. Auch wurde die Hugging-Face-Implementierung von SynthID-Text verwendet, nicht die spezifische Implementierung, die Anthropic einsetzen wird. Die genaue Konfiguration, Fehlertoleranz und internen Sicherheitsebenen der Produktionssysteme können sich erheblich unterscheiden.

Dennoch gilt das Grundprinzip: Wenn Tournament Sampling das Token-Auswahl-Verhalten verändert, sind Nebeneffekte auf das Gesamtmodellverhalten systematisch möglich – unabhängig von der konkreten Implementierung. Die Forschung liefert keinen Beweis für eine spezifische Schwachstelle in Claude, aber sie liefert einen starken Hinweis auf eine Klasse von Risiken, die mit dem Ansatz verbunden ist.

Regulatorische Anforderung trifft technische Realität

Die übergeordnete Botschaft ist eine, die Unternehmen und KI-Entwickler gleichermaßen betrifft: Compliance-Anforderungen und Sicherheitsarchitektur sind keine getrennten Welten. Wenn regulatorische Vorgaben – hier die EU-Kennzeichnungspflicht für KI-Inhalte – technische Eingriffe in Inferenzsysteme notwendig machen, müssen diese Eingriffe vollständig auf ihre Sicherheitsimplikationen getestet werden.

Dr. Maik Bunzel von mabucon.eu fasst die Konsequenz für seine Kunden so zusammen: „Wer KI-Agenten in kritischen Geschäftsprozessen einsetzt, kann sich nicht darauf verlassen, dass das Sicherheitsverhalten eines Modells nach einem Update oder einer Konfigurationsänderung identisch bleibt. Continuous Security Testing wird zur Pflicht, nicht zur Kür."

Für die Branche ergibt sich daraus eine wichtige Erkenntnis: Die Ära einfacher, statischer Sicherheitsannahmen für LLMs ist vorbei. Wasserzeichen, Fine-Tuning, Quantisierung, Prompt-Engineering – jede Schicht, die auf einem Basismodell aufgebracht wird, kann unerwartete Wechselwirkungen mit dessen Sicherheitseigenschaften erzeugen. Die Antwort darauf ist nicht weniger KI-Einsatz, sondern strukturierteres, kontinuierlicheres und realistischeres Testen – unter den Bedingungen, unter denen das System tatsächlich betrieben wird.

Ausblick: Was Unternehmen jetzt tun sollten

Die SynthID-Forschung ist ein Frühwarnsignal, kein Katastrophenszenario. Wer heute die richtigen Schlüsse zieht, ist morgen besser aufgestellt. Konkret bedeutet das: Sicherheitsverantwortliche in Unternehmen, die LLM-basierte Systeme betreiben, sollten aktiv bei ihren Modell-Anbietern nachfragen, welche Wasserzeichen-Konfigurationen eingesetzt werden und ob die spezifischen Sicherheitseigenschaften des Modells unter dieser Konfiguration getestet wurden. KI-Sicherheit ist kein einmaliges Projekt – sie ist ein laufender Prozess, der mit jeder technischen Schicht wächst, die einem Sprachmodell hinzugefügt wird.

Kontakt

Welcher Ihrer Abläufe soll als Erstes intelligenter werden?

Beschreiben Sie kurz, welchen Prozess Sie KI-gestützt unterstützen oder ersetzen möchten. Wir melden uns mit einer ersten, konkreten Einschätzung — unverbindlich und vertraulich.