
Anthropic explica como o Claude marca textos com 'água invisível'
A Anthropic detalhou o funcionamento da marca d'água estatística que o Claude aplica aos textos que gera, baseada na técnica SynthID-Text do Google DeepMind, para cumprir regras de transparência de IA da União Europeia.
Por Elias Brandão · Analista de IA e ética
Uma senha escondida entre as palavras
Imagine um professor que, ao corrigir redações, sempre risca a palavra "cinzento" e escreve "nublado" no lugar — não porque uma esteja errada, mas para deixar sua marca pessoal em qualquer texto que passou por sua mão. É mais ou menos assim que funciona a nova marca d'água do Claude, o assistente de IA da Anthropic: em vez de tinta, a empresa usa uma chave criptográfica que orienta, de forma sutil, a escolha entre palavras equivalentes durante a geração da resposta.
Como funciona na prática
Foto: reprodução/theverge.com
A tecnologia é uma adaptação do SynthID-Text, método publicado pelo Google DeepMind na revista Nature em 2024, a partir de uma proposta do pesquisador Scott Aaronson de 2022. Em vez de sortear cada palavra de forma totalmente aleatória, o sistema usa uma chave secreta combinada com as palavras anteriores para decidir qual termo escolher entre opções semanticamente parecidas. O resultado são palavras que continuam soando naturais, mas que, somadas ao longo de um texto suficientemente extenso, formam um padrão estatístico verificável por quem tem a chave.
A Anthropic afirma que a técnica não exige tokens extras nem eleva o custo de uso, e que testes internos não encontraram impacto perceptível na qualidade, criatividade ou legibilidade das respostas — achado que o próprio Google DeepMind já havia confirmado em avaliações com tráfego do Gemini.
Por que agora: a régua europeia
A motivação não é puramente técnica. A Anthropic assinou, em julho de 2026, o Code of Practice on Transparency of AI-Generated Content da União Europeia — acordo que reúne cerca de 190 signatários e passou a exigir, a partir de 2 de agosto de 2026, que provedores de IA sinalizem conteúdo gerado por seus modelos. A empresa decidiu aplicar a marcação globalmente, e não só a usuários europeus, alegando que ainda não tem uma forma confiável de restringir a medida por região.
Os limites da marca invisível
Aqui entram os dois lados do debate. De um lado, a rastreabilidade ajuda a identificar textos de IA em meio a fraudes, desinformação ou uso indevido em sala de aula. De outro, o próprio sistema reconhece suas fragilidades: funciona melhor em textos longos e narrativos, mas perde força em conteúdos curtos, respostas factuais e código — justamente onde há pouca margem para trocar uma palavra por outra sem comprometer a precisão. Uma reescrita completa do texto também pode apagar o padrão. Ou seja: um detector positivo indica que o Claude provavelmente participou da produção do texto, mas não diz se foi autor único ou apenas revisor — e nada garante que a marca resista a mãos mais criativas na hora de burlar o sistema.
Atualização (19/08, 19:00): Horas depois de a Anthropic detalhar a marca d'água invisível do Claude, código publicado no GitHub já promete apagá-la reescrevendo o texto com outro modelo de IA.