Aufgrund von EU-Vorgaben

Claude versieht Texte mit einem Wasserzeichen

Uhr
von Tobias Seefeld und jor

Im Rahmen des AI Acts fordert die EU ein maschinenlesbares Wasserzeichen für KI-generierte Inhalte. Anthropic ist dieser Forderung nun nachgekommen und hat eine Methode eingeführt, mit der Claude seine Texte kennzeichnet. In einem Blogpost erklärt das Unternehmen, wie diese Methode funktioniert.

(Source: imago-images.de)
(Source: imago-images.de)

Texte, die Anthropics Claude generiert hat, enthalten neu ein maschinenlesbares Wasserzeichen. Damit erfüllt der KI-Entwickler gemäss eigenen Angaben die entsprechende Forderung des AI Acts der EU. Zudem erklärt das Unternehmen in einem Blogpost, wie dieses Wasserzeichen technisch funktioniert.

KI-Modelle wie Claude schreiben Texte, indem sie ein Wort nach dem anderen generieren und dabei jeweils jenes Wort auswählen, das angesichts der vorangegangenen Wörter am wahrscheinlichsten ist. Wenn zwei potenziell passende Wörter dieselbe Wahrscheinlichkeit aufweisen, entscheidet ein Zufallsgenerator. Und auf diesem Zufallsprinzip basiert die Kennzeichnungsmethode, wie es im Blogpost heisst.

Neu liege nämlich jedem Claude-Text ein bestimmter Schlüssel zugrunde, den das KI-Modell anstelle einer zufälligen Zahl benutze, um solche Entscheidungen zu treffen. So sei das Resultat für den User noch immer zufällig. Laut Anthropic kann jedoch ein entsprechendes Kontroll-Tool mit dem Schlüssel überprüfen, ob die KI die erwarteten Entscheidungen getroffen hat. Je grösser die Übereinstimmung, desto wahrscheinlicher stammt der Text von Claude.

Vorteile und Limitierungen

Diese Methode verändert weder den Inhalt noch den Stil des Textes, und das KI-Modell benötigt dadurch laut Anthropic auch keine zusätzlichen Tokens. Das Kontroll-Tool könne mit dem Schlüssel nun lediglich prüfen, wie wahrscheinlich es sei, dass Claude einen Text geschrieben habe. Darin liege auch die grösste Limitierung dieses Wasserzeichens: Je kürzer ein Text ist und je mehr Fakten er enthält, die wenig Spielraum bei der Wortwahl lassen, desto ungenauer fällt laut Blogpost die Überprüfung aus. 

Dies gelte auch für Code, der typischerweise eine fixe Struktur habe, die wenig Variation zulasse. Eine Ausnahme würden dabei etwa Kommentare im Code bilden, deren Formulierungen freier seien und daher eher den Zufallsgenerator erforderten.

Und was, wenn Claude etwas anderes als Text ausgeben soll? Auch KI-generierte Bilder hätten ein Wasserzeichen, schreibt Anthropic. Das Unternehmen kennzeichne diese jedoch nicht mit der oben beschriebenen Methode, sondern mit einer C2PA-Signatur in den Metadaten der Datei. Auf dieselbe Weise hinterlassen Kamerahersteller und Bildbearbeitungssoftware schon seit Jahren Signaturen in Bildern.

 

Übrigens: Ein KI-Modell von Anthropic ist kürzlich aus einer sicher geglaubten Umgebung ausgebrochen und hat unter anderem Phishing-E-Mails verschickt. Lesen Sie hier mehr dazu.

Webcode
CvQtWTKt