Recht

Anthropic: Nur komplette Neufassung entfernt Claude-Wasserzeichen

3 Min. Lesezeit

TL;DR Too Long; Didn’t read

Anthropic hat gegenüber TechCrunch erstmals technische Details zum Text-Wasserzeichen offengelegt, das Claude seit dem 11. August in allen Antworten hinterlässt. Nur eine vollständige Neuformulierung jedes Wortes entfernt die Markierung demnach zuverlässig, leichte Bearbeitung übersteht sie meist. Bei generiertem Programmcode bleibt das Verfahren dagegen weitgehend wirkungslos.

Eine Lupe macht in handgeschriebenen Textzeilen ein verborgenes Wellenmuster sichtbar, während ein Radiergummi das Muster in einer der Zeilen vollständig entfernt; daneben klebt ein Anthropic-Logo-Sticker. Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • Ein Anthropic-Ingenieur erläuterte TechCrunch erstmals die Wortwahl-Technik hinter Claudes Text-Wasserzeichen.
  • Erst der komplette Ersatz jedes Wortes entfernt die Markierung zuverlässig, kleinere Änderungen übersteht sie meist.
  • Programmcode bleibt wegen begrenzter Wortwahl kaum markierbar, allenfalls Kommentare lassen sich erfassen.
  • Grundlage ist eine Variante von Googles 2024 in Nature veröffentlichtem SynthID-Text-Verfahren.
  • Für die versprochene öffentliche Erkennungs-API nennt Anthropic weiterhin keinen Starttermin.
  • Nutzerreaktionen reichen von Abo-Kündigungen aus Protest bis zu Zustimmung für mehr Transparenz.

Anthropic hat gegenüber TechCrunch erstmals technische Details zum Text-Wasserzeichen offengelegt, das Claude seit dem 11. August in allen Antworten hinterlässt. Nur eine vollständige Neuformulierung jedes Wortes entfernt die Markierung demnach zuverlässig, leichte Bearbeitung übersteht sie meist. Bei generiertem Programmcode bleibt das Verfahren dagegen weitgehend wirkungslos.

Synonym-Wahl bei jedem Wort kodiert das Signal

Anthropic setzt eine Variante von Googles SynthID-Text-Verfahren ein, das DeepMind 2024 in der Fachzeitschrift Nature veröffentlichte. Laut dem Anthropic-Ingenieur, der die Details gegenüber TechCrunch offenlegte, treffe Claude bei jeder Textantwort fortlaufend sogenannte Low-Stakes-Entscheidungen zwischen bedeutungsgleichen Wörtern – etwa zwischen „bedeckt” und „grau” für eine Wetterbeschreibung. Über viele solcher Wortpaare hinweg entstehe ein Muster, das für Leser unsichtbar bleibe, sich mit dem passenden Schlüssel aber auslesen lasse. Das Modell selbst bemerke diesen Vorgang nicht, da die Markierung unabhängig von Claudes eigentlicher Antwortgenerierung im Hintergrund ablaufe.

Das Support-Center von Anthropic hält dazu ergänzend fest: Das Wasserzeichen verändert weder Bedeutung noch Lesbarkeit der Antwort. Weil die Markierung Teil des Textes selbst und keine separate Metadatei ist, wandert sie beim Kopieren automatisch mit. Kurze Absätze oder faktenlastige Passagen mit wenigen austauschbaren Formulierungen ergeben dagegen ein schwächeres, teils nicht mehr auswertbares Signal. Für Redaktionen und Bildungseinrichtungen bedeutet das: Auch unauffällige, sachliche Texte lassen sich potenziell zurückverfolgen, sofern sie lang genug sind.

Nur vollständige Neufassung entfernt die Markierung zuverlässig

Im ursprünglichen Bericht vom 11. August blieb offen, wie viel Bearbeitung nötig ist, damit die Kennzeichnung verschwindet. Der Anthropic-Ingenieur präzisierte gegenüber TechCrunch: Leichte Änderungen einzelner Sätze oder eine Übersetzung überstünden das Muster meist. Es verschwinde aber erst zuverlässig, wenn praktisch jedes Wort einer Antwort ersetzt werde. Für den Büroalltag bedeutet das: Ein direkt kopierter Absatz aus einer Claude-Antwort bleibt auch nach kleineren redaktionellen Eingriffen grundsätzlich rückverfolgbar, solange er nicht Wort für Wort neu formuliert wird.

Bei generiertem Programmcode versagt das Verfahren dagegen weitgehend. Weil Quellcode meist nur eine syntaktisch korrekte Lösung zulässt, bleibt für austauschbare Wortwahl kaum Spielraum. Allenfalls Kommentare im Code lassen sich zuverlässiger markieren als die eigentliche Programmlogik. Auf diese grundsätzliche Schwäche heutiger Verfahren wies bereits die Forschungsübersicht zu KI-Wasserzeichen von Ende Juli hin: Alle drei dort getesteten Methoden verloren ihre forensische Aussagekraft fast vollständig nach einfachem Umformulieren. Für Entwicklerteams, die Claude beim Programmieren einsetzen, bleibt die Herkunft von generiertem Code damit praktisch nicht nachweisbar.

Erkennungswerkzeug bleibt angekündigt, Termin weiter offen

Auf Nachfrage bestätigte der Anthropic-Ingenieur, eine öffentliche Erkennungs-API komme, die Nutzer künftig selbst einsetzen könnten – einen Starttermin nenne Anthropic weiterhin nicht. Unabhängig nicht verifiziert ist bislang, wie zuverlässig diese künftige API die beschriebenen Grenzfälle bei Neufassungen und Code tatsächlich erkennen wird. Andere Anbieter arbeiteten demnach an vergleichbaren, nicht zwingend kompatiblen Verfahren. Für Unternehmen, die auf Nummer sicher gehen wollen, bleibt bis dahin nur die Selbstauskunft der Anbieter als Anhaltspunkt.

Die Reaktionen auf die Offenlegung fallen gemischt aus: Einzelne Claude-Nutzer kündigten aus Protest gegen die unsichtbare Kennzeichnung ihr Abonnement. Andere begrüßen den Schritt als überfälligen Beitrag zur Transparenz bei KI-generierten Inhalten. Am grundsätzlichen Zugang und Preis ändert die Klarstellung nichts: Die Markierung läuft weiterhin automatisch und kostenlos im Hintergrund aller Claude-Produkte.

Offen bleibt, ob die angekündigte Erkennungs-API die jetzt bekannten Lücken bei Neufassungen und Programmcode transparent ausweist, sobald sie verfügbar ist, oder Nutzern eher ein trügerisches Gefühl von Gewissheit vermittelt.

Häufige Fragen

Wann startet die angekündigte Erkennungs-API für Claude-Wasserzeichen?

Einen festen Termin nennt Anthropic weiterhin nicht. Bestätigt ist nur, dass Nutzer die API künftig selbst einsetzen können sollen.

Markiert Anthropic auch von Claude geschriebenen Programmcode?

Kaum. Weil Code meist nur eine syntaktisch korrekte Lösung zulässt, bleibt wenig Spielraum für die Wortwahl-Technik; allenfalls Kommentare lassen sich zuverlässiger erfassen.

Reicht leichtes Umformulieren, um die Markierung zu entfernen?

Nein. Laut Anthropic übersteht das Wasserzeichen leichte Bearbeitung und Übersetzung meist. Erst wenn praktisch jedes Wort ersetzt wird, verschwindet das Signal zuverlässig.

Setzen auch andere KI-Anbieter vergleichbare Wasserzeichen ein?

Ja, laut Anthropic arbeiten weitere Unternehmen an ähnlichen Verfahren. Diese müssen untereinander aber nicht kompatibel sein.

Bemerkt Claude selbst, dass eine Markierung eingebettet wird?

Nein. Der Prozess läuft laut Anthropic unabhängig von der eigentlichen Antwortgenerierung im Hintergrund ab, ohne dass das Modell davon Kenntnis hat.

Quellen (2)
  1. Anthropic shares more details about how Claude's new watermarks will work (TechCrunch)
  2. How Claude marks AI-generated content (Anthropic Help Center)

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog