← Tilbage til oversigten

KI-vandmærker og sikkerhedssårbarheder: Når SynthID-Text underminerer beskyttelsesbarriererne

Dr. Maik Bunzel
Dr. Maik Bunzel
22.09.2026 · 6 min. læsetid
KI-vandmærker og sikkerhedssårbarheder: Når SynthID-Text underminerer beskyttelsesbarriererne

Når transparens bliver en sårbarhed: Paradokset ved AI-vandmærker

Den Europæiske Union har med sin AI-regulering indvarslet en ny æra for sporbarhed. AI-genereret indhold skal kunne mærkes – og store platforme reagerer prompte. Anthropic har annonceret, at fremtidige Claude-modeller vil blive udstyret med SynthID-Text, en vandmærketeknologi, der oprindeligt er udviklet af Google og udgivet som open source-løsning. Det lyder godt – mere transparens, mere sporbarhed – men det har en brændbar bagside, som virksomheder bør kende til hurtigst muligt.

Ny sikkerhedsforskning fra Lasso Security viser: SynthID-Text påvirker ikke blot sprogmodellers ordvalg, men ændrer under visse betingelser også deres sikkerhedsadfærd. Modeller, der normalt ville afvise skadelige anmodninger, kan i nogle tilfælde udføre dem, når vandmærket er aktiveret. For virksomheder, der anvender AI-agenter i produktionen, er det en kritisk information.

Sådan fungerer SynthID-Text teknisk set

For at forstå problemets rækkevidde er det værd at se nærmere på mekanikken. Sprogmodeller genererer tekst ved sekventielt at vælge det mest sandsynlige næste token (forenklet: det næste ord eller ordfragment) fra en mængde kandidater. SynthID griber ind i denne proces uden at forvrænge den på åbenlys vis – deraf også betegnelsen „non-distortionary".

Kernen i SynthID er det såkaldte Tournament Sampling: Ligesom i en sportsturnering sættes talrige token-kandidater op imod hinanden. En hemmelig nøgle tildeler hver kandidat en skjult sandsynlighedsværdi. Par konkurrerer mod hinanden, den kandidat med den højeste vurdering vinder og går videre til næste runde – indtil et endeligt token er fundet. Resultatet: Ordvalget virker tilfældigt, men er påvirket af den hemmelige nøgle på en sådan måde, at indviede efterfølgende kan fastslå, om en tekst er genereret ved hjælp af denne nøgle.

„Vandmærker er designet til at være umærkelige for læseren. Men vi ved: Når vi ændrer noget som helst ved det, modellen genererer, opstår der kompromiser – og de dukker op et sted." – Andrea Siposova, AI-sikkerhedsforsker hos Lasso Security

Netop dette „et sted" er problemet. Forskeren testede SynthID-Text på seks open-weight-modeller og sammenlignede deres adfærd med og uden aktiveret vandmærke – særligt i håndteringen af skadelige anmodninger og ved anvendelse af Prompt-Injection-teknikker.

Sampling Drift: Det egentlige sikkerhedsproblem

Forskningen introducerer et nyt begreb, som branchen vil beskæftige sig med fremover: Sampling Drift. Hermed menes den forskydning i modellens adfærd, der opstår som følge af den ændrede sampling-proces. Denne drift er ikke ubetydelig: Den berører ikke blot formuleringen af svar, men også om en model afviser en skadelig anmodning eller ej – og i konteksten af AI-agenter endda hvilke værktøjer der kaldes, og hvilke argumenter der overføres.

  • Ændret afvisningsadfærd: Modeller med aktiveret SynthID-vandmærke afviste i tests skadelige anmodninger sjældnere end uden vandmærke.
  • Forstærket effekt ved Prompt Injection: Når skadelige anmodninger blev kombineret med Prompt-Injection-teknikker, var sikkerhedsforskellen særligt udtalt.
  • Nøgleafhængig variation: Omfanget af adfærdsændringen varierede afhængigt af den anvendte hemmelige nøgle – nogle nøgler øgede markant efterlevelsen af skadelige anmodninger, andre reducerede den.
  • Fejl ved Tool Calls: I agentsammenhæng ændrede vandmærket, hvilke værktøjer der blev kaldt korrekt – med til tider betydelige afvigelser fra grundnøjagtigheden uden vandmærke.

Det, der gør disse erkendelser særligt relevante: KI-agenter agerer ikke passivt. De kalder APIs, udfører kode, sender e-mails og tilgår databaser. En svækket sikkerhedsbarriere på modelniveau bliver i agentsammenhæng umiddelbart til et handlingsniveau – med reelle konsekvenser.

Vurdering i forhold til erhvervsbrug

Dr. Maik Bunzel, grundlægger og administrerende direktør for mabucon.eu, der arbejder intensivt med produktiv anvendelse af KI-agenter i virksomhedsprocesser, fremhæver i denne sammenhæng en grundlæggende udfordring: „De fleste virksomheder tester deres KI-systemer under ideelle betingelser. Sikkerhedsegenskaber som afvisningsadfærd antages ofte at være stabile og uforanderlige – det er en farlig fejltagelse, når produktionsmiljøer afviger fra testmiljøet."

Det er præcis tilfældet her. Vandmærkelaget, der er påkrævet af regulatoriske årsager, er ikke en neutral tilføjelse – det er et indgreb i modellens inferensproces. Dette indgreb kan ændre sikkerhedsrelevante egenskaber, der tidligere blev etableret gennem omfattende RLHF (Reinforcement Learning from Human Feedback) og Safety Fine-Tuning.

For virksomheder, der bygger agent-workflows på basis af modeller som Claude eller andre regulerede LLMs, opstår der heraf et klart behov for handling:

  • Red-Teaming under reelle betingelser: Sikkerhedstests skal udføres eksplicit med aktiveret vandmærke – ikke kun i modellens basiskonfiguration.
  • Systematisering af Prompt-Injection-tests: Da effekten er særligt stærk ved kombinerede angreb, bør Prompt-Injection-scenarier være et obligatorisk element i enhver LLM-sikkerhedsrevision.
  • Separat afprøvning på agentniveau: Ændret Tool-Calling-adfærd kan ikke alene opdages gennem tests på modelsvarsniveau – agent-pipelines kræver selvstændige sikkerhedstests.
  • Forstå nøglehåndtering som sikkerhedsparameter: Da forskellige nøgler producerer forskellige sikkerhedsegenskaber, er valget og håndteringen af vandmærkenøglen ikke blot en teknisk, men også en sikkerhedspolitisk beslutning.

Forskningens begrænsninger – og hvad der alligevel gælder

Det ville være useriøst at overse studiets begrænsninger. Undersøgelsen testede seks open-weight-modeller – ikke selve Claude-modellen, som Anthropic fremover vil udruste med SynthID. Der blev desuden anvendt Hugging Face-implementeringen af SynthID-Text, ikke den specifikke implementering, som Anthropic vil tage i brug. Den præcise konfiguration, fejltolerance og interne sikkerhedslag i produktionssystemerne kan afvige væsentligt.

Ikke desto mindre gælder grundprincippet: Hvis Tournament Sampling ændrer adfærden ved token-udvælgelse, er sideeffekter på den samlede modeladfærd systematisk mulige – uafhængigt af den konkrete implementering. Forskningen leverer ikke bevis for en specifik sårbarhed i Claude, men den leverer et stærkt signal om en klasse af risici, der er forbundet med tilgangen.

Regulatoriske krav møder teknisk virkelighed

Det overordnede budskab er ét, der vedrører virksomheder og KI-udviklere i lige høj grad: Compliance-krav og sikkerhedsarkitektur er ikke adskilte verdener. Når regulatoriske krav – her EU's mærkningspligt for KI-indhold – nødvendiggør tekniske indgreb i inferenssystemer, skal disse indgreb testes fuldt ud for deres sikkerhedsmæssige implikationer.

Dr. Maik Bunzel fra mabucon.eu opsummerer konsekvensen for sine kunder således: „Den, der anvender KI-agenter i kritiske forretningsprocesser, kan ikke forlade sig på, at en models sikkerhedsadfærd forbliver identisk efter en opdatering eller en konfigurationsændring. Continuous Security Testing bliver en nødvendighed, ikke et valg."

For branchen giver dette en vigtig erkendelse: Æraen med enkle, statiske sikkerhedsantagelser for LLM'er er forbi. Vandmærker, Fine-Tuning, kvantisering, Prompt-Engineering – hvert lag, der lægges oven på en basismodel, kan skabe uventede vekselvirkninger med dens sikkerhedsegenskaber. Svaret herpå er ikke mindre brug af KI, men mere struktureret, kontinuerlig og realistisk testning – under de betingelser, som systemet faktisk drives under.

Perspektiv: Hvad virksomheder bør gøre nu

SynthID-forskningen er et tidligt advarselssignal, ikke et katastrofescenarie. Den, der drager de rigtige konklusioner i dag, er bedre stillet i morgen. Konkret betyder det: Sikkerhedsansvarlige i virksomheder, der driver LLM-baserede systemer, bør aktivt spørge deres modelleverandører, hvilke vandmærkekonfigurationer der anvendes, og om de specifikke sikkerhedsegenskaber ved modellen er testet under denne konfiguration. KI-sikkerhed er ikke et engangsprojekt – det er en løbende proces, der vokser med hvert teknisk lag, der tilføjes en sprogmodel.

Kontakt

Hvilken af dine arbejdsgange skal være den første til at blive klogere?

Beskriv kort, hvilken proces du vil understøtte eller erstatte ved hjælp af AI. Vi vender tilbage med en første, konkret vurdering — uforpligtende og fortroligt.