AI Act: Anthropic first LLM to add invisible watermarks in AI-generated text, not just in images, by manipulating the token probabilities. First tool emerging to remove the watermarks again.

(edited)

Mittlerweile werden weitere globale Auswirkungen des EU AI Acts bekannt. Anthropic (Claude) und praktisch alle amerikanischen KI-Anbieter haben sich dazu verpflichtet, bei neuen Modellen ab dem 2. August 2026, auch in KI-generierten Texten, ein unsichtbares Wasserzeichen einzubauen. Nicht nur bei Bildern, Videos und Audio.

Und zwar soll dies unbemerkt über die Manipulation der Token-Wahrscheinlichkeiten stattfinden, d.h. der ausgegebene Text wird ein wenig manipuliert und umgeschrieben, um ein maschinen-erkennbares Muster einzubauen.

Als vereinfachtes Beispiel würde statt

"Kaffee mit Sahne"

die KI dann "Kaffee und Sahne" oder "Kaffee plus Sahne" generieren, um den Text als KI-generiert erkennbar zu machen.

Die Veränderungen der Tokens soll so minimal ausfallen, dass sie von Menschen kaum wahrnehmbar sei. Trotzdem gibt es viel Kritik dazu, da die Ausgabe der KI dann nicht mehr ganz authentisch ist und künstlich verfälscht wird. Auch generierter Code könnte davon betroffen sein.

Weiters ist das Wasserzeichen und die Erkennung nicht bullet-proof, d.h. nicht 100% akkurat, was die Sinnhaftigkeit von diesen Wasserzeichen in Frage stellt.

Wasserzeichen können entfernt bzw. falls der Code und der Schlüssel geleakt werden, auch künstlich hinzugefügt werden.

In Wirklichkeit gibt es in der Zukunft, eigentlich bereits jetzt, keine Garantie mehr, ob etwas mit KI geschrieben, mit KI bearbeitet oder mit KI lektoriert wurde. Nur Wahrscheinlichkeiten, die aber auch manipuliert werden können.

Letztendlich sollte es in Zukunft, wo fast alles KI-generiert oder optimiert sein wird, eigentlich egal sein, welches Tool man für einen Output verwendet hat.

Wichtiger ist, wer etwas gepostet hat und was, nicht mit welchem Tool etwas bearbeitet wurde.

Die ganze KI-Kennzeichnungspflicht der EU könnte sich zu so etwas wie Cookie Banners 2.0 entwickeln, meine Befürchtung, und die KI-Entwicklung und Adoption eher bremsen als unterstützen.

Andererseits gibt es auch Use-Cases, wo es Sinn macht, KI-generierten Content klar kennzeichnen zu müssen, zum Beispiel bei Deepfakes. Aber auch hier sind die Grenzen fließend. Was ist ein Deepfake, was ein Meme? Bots werden sich kaum an die Kennzeichnungspflicht halten und Wasserzeichen zunehmend entfernen.

Was haltet ihr von den neuen Wasserzeichen bei KI-generierten Texten? Sinnvolle Maßnahme, um KI-Slop zu bekämpfen, oder bald so nervig wie Cookie Banners?

image.png

https://x.com/vedolos/status/2087150269704687983

https://x.com/aakashgupta/status/2087032260029780399

https://x.com/NeerajKA/status/2087131971696595091

https://x.com/dieaud91/status/2087055686551106011

https://x.com/mertesakib/status/2087075599193956388

https://x.com/jmrphy/status/2087192754858197372

English

Meanwhile, further global implications of the EU AI Act are coming to light. Anthropic (Claude) and virtually all American AI providers have committed to embedding an invisible watermark in new models released on or after August 2nd, 2026, including in AI-generated text, not just in images, videos, and audio.

Specifically, this is to be done imperceptibly by manipulating token probabilities—that is, the output text will be slightly altered and rewritten to incorporate a machine-recognizable pattern.

As a simplified example, instead of

“coffee with cream”

the AI would generate “coffee and cream” or “coffee plus cream” to make the text recognizable as AI-generated.

The changes to the tokens are intended to be so minimal that they are barely perceptible to humans. Nevertheless, there is a lot of criticism of this approach, as the AI’s output is then no longer entirely authentic and appears artificial. Generated code could also be affected by this.

Furthermore, the watermark and its detection are not bulletproof, that is, not 100% accurate, which calls into question the usefulness of these watermarks.

Watermarks can be removed or, if the code and key are leaked, even artificially added.

In reality, in the future, and actually even now, there is no longer any guarantee that something was written, edited, or proofread using AI. There are only probabilities, which can also be manipulated.

Ultimately, in a future where almost everything will be generated or optimized by AI, it shouldn’t really matter which tool was used to produce the output.

What’s more important is who posted what, not which tool was used to edit it.

I fear that the EU’s entire AI labeling requirement could turn into something like “Cookie Banners 2.0,” and that it will rather slow down than support AI development and adoption.

On the other hand, there are also use cases where it makes sense to clearly label AI-generated content, such as with deepfakes. But even here, the lines are blurred. What is a deepfake, and what is a meme? Bots are unlikely to comply with the labeling requirement and will increasingly remove watermarks.

What do you think of the new watermarks on AI-generated text? A sensible measure to combat AI slop, or will they soon be as annoying as cookie banners?

0.50214190 BEE
2 comments

Macht gar keinen Sinn finde ich, wird immer wege geben es auszuhebeln.

Da sollten die sich was anderes ausdenken.

0.00000000 BEE

Was für ein Schwachsinn. Dafür hat die EU Ressourcen, aber die Grenze und ihre Kultur und Werte zu schützen, das ist keine Priorität.

0.00000000 BEE